Skip to content

Instantly share code, notes, and snippets.

View acmerfight's full-sized avatar

Gangqiang Yao acmerfight

View GitHub Profile
@acmerfight
acmerfight / 00-README.md
Last active September 12, 2026 15:16
关掉等待工具,Codex 反而更省 token|Astra low 三对实验:结论、官方 API 费用、最终配图、原始数据与复现方法

关掉等待工具,Codex 反而更省 token:Astra low 三对实验

作者:@yaogangqiang · 实验日期:2026-09-12

这是分享文章的实验配套页:结论、过程、逐对结果与复现方法放在一起。下文只统计本次 Astra 的六次正式运行,不合并其他模型或先前的探索实验。

结论先说

在本次“等待文件出现”的任务里,关闭原生 clock.sleep 后,Astra low 的三个运行都用了更少的模型响应、总输入和输出 token,并且更早回复。

@acmerfight
acmerfight / 00-README.md
Last active September 10, 2026 15:54
DSH actual version comparison: same DeepSeek Flash, 20 paired sessions, cache-aware token accounting

同一个 DeepSeek Flash,DSH 更新前后如何改变 Token 消耗?

20 组真实旧/新版配对已完成:总 Token +2.4%,其中非缓存输入 -56.8%;按同一套官方价格计算的费用 -36.6%。 旧版准确答案 119/120,新版 120/120。所有答案,包括错误答案,都计入消耗。

本报告比较 DSH 的两个真实历史提交,使用同一个 deepseek-flash 模型。此前“同版本机制开关”实验是另一个消融实验,其 −35.8% 不能作为本次版本对照的结果。

Token 构成

先看 Token,明确哪些属于缓存

@acmerfight
acmerfight / 00-README.md
Last active September 10, 2026 14:18
DeepSeek 系统提示词更新机制:同版 DSH 开关对照,30 对 / 360 响应,费用 −35.8%、总 Token +2.4%|六图、边界实验与完整复算证据

实验类型说明:这是同一个 DSH 版本的机制开关消融,不是实际旧/新版比较。真实版本对照已另做 20 组配对、240 个响应,见新报告。本页 −35.8% 只属于历史消融实验。

DeepSeek V4.1 Flash:保住缓存,真的省了吗?

开启 DSH 的系统提示词追加机制后,这组实验的整段会话费用估值下降 35.8%,总 Token 却增加 2.4%。 这项优化的收益不能用“少了多少 Token”单独衡量。

同一版 DSH、同一个 Flash 模型,只切换有没有这个机制。主实验为 5 个固定合成业务工作流、30 组配对、60 个六轮会话,共 360 个真实模型响应。完整输出验收:关闭 178/180,开启 179/180。并非零错误,也不足以证明普遍更准确。

费用包含初始输入、续聊、两次规则更新和思考输出,统一按官方峰时价估算,不是实际账单或订阅额度。本轮 low thinking,无工具调用或压缩;结论不直接推广到所有编程任务。

@acmerfight
acmerfight / 00-README.md
Last active September 10, 2026 09:04
新上下文模式的成本:五类固定任务,30 对 / 60 次实测,费用 +22.2%|图表、完整数据与复现脚本

CONTEXT COST STUDY · 2026.09.10 · FROZEN BENCHMARK

开启新上下文模式,任务成本怎样变?

在这五个固定任务中,新模式的 API 费用估值高 22.2%,总 Token 多 19.5%;60 次正式运行全部通过相同验收。

费用差异的 95% 区间为 +11.2%~+33.9%。这轮没有观察到节省,但也没有发生自然跨窗口,因此不能据此判断上下文耗尽后的压缩与恢复收益。

ON cost 22.2% more in this study, with 19.5% more total tokens. All 60 runs passed acceptance; no context-window transitions occurred.

@acmerfight
acmerfight / 00-READ-ME.md
Last active September 10, 2026 08:51
Codex 等待为何仍消耗 token:图解源码、Astra low 实测、17 次受控对照与复现脚本

Codex 等待子任务时,为什么还会消耗 token?一次可以自己复现的源码实验

已经验证: 空等待超时后,Codex 会再次请求模型;延长等待仍允许用户输入提前唤醒。
尚未验证: 这些请求具体扣掉多少订阅额度,以及提示词冲突是否导致模型主动频繁轮询。

实验日期:2026-09-08 至 2026-09-09。真实模型调用使用 GPT-6 Astra / low。本 Gist 包含图解、原始实验的脱敏结果、可执行脚本、固定源码链接和复现步骤。无需先懂 Rust;最快的复现只需 Python 和 Codex CLI。

2026-09-09 更新:这次真的调用了 Astra low,也跑了真实子 agent。

先前的 17 次受控运行使用本地 mock;下面新增的是 4 个真实主会话、4 个真实子 agent,共 18 次模型请求。全部从会话日志核验为 Astra low。两轮回答不同的问题,不能混算。

@acmerfight
acmerfight / README.md
Created September 7, 2026 08:10
GPT-6 Astra low: Codex experimental notes/history vs remote compaction — reproducible single-run comparison

GPT-6 Astra / low:Codex 新上下文机制与远端压缩的一次小型对照

结论:两组代码检查都是 63/63。一个被要求不写进笔记的历史编号,新机制通过历史工具查回;旧组没恢复,也没有编造。

这是一次能力演示,不是统计 benchmark,不证明新机制全面胜出。实验由 Codex 辅助搭建、执行和整理;包含可离线核对的代码、逐项评分与线上复跑脚本。

1. 环境与策略

  • 实验日期:2026-09-07。
  • 实际执行客户端:codex-cli 0.153.4,macOS。
@acmerfight
acmerfight / README.md
Last active September 3, 2026 14:34
Reproduction for earendil-works/pi#9073

JsonlSessionRepo cwd-encoding collision reproduction

Reproduction for earendil-works/pi#9073, verified against commit e44d75c20a51142abc056c243b13c1d7bb4be687.

The patch adds one regression test to packages/agent/test/harness/jsonl-session-repo.test.ts. It fixes the clock, creates the same explicit ID in two distinct cwd values whose encoded directory names collide, and requires distinct physical paths and cwd-scoped discovery.

Run

From the repository root, with the patch file in that directory:

@acmerfight
acmerfight / 00-README.md
Last active August 17, 2026 07:51
插件化不会消灭复杂度:从 VS Code、Shopify、Segment 到 Cordis / DeepSeek Harness 的事实审计

插件化不会消灭复杂度

同进程插件、扩展宿主与独立服务的运行拓扑

从 VS Code 扩展问题、Shopify 边界复盘到 Cordis / DeepSeek Harness

事实审计 · 2026-08-17 · DSH 47f943859bef60e4160492346772ded9b24f765a

@acmerfight
acmerfight / 00-README.md
Last active August 15, 2026 09:21
插件不是外挂:读懂 DeepSeek Harness 的「一切皆插件」

插件不是外挂:读懂 DeepSeek Harness 的「一切皆插件」

三种插件架构:Hook、扩展 API 与插件化运行时

一段从 AFFiNE、Cordis、Effect 一路谈到 General Magic 的发言,真正想说什么?


@acmerfight
acmerfight / deepseek-harness-fact-check.md
Created August 13, 2026 16:25
DeepSeek Harness 深度事实核查:Cordis、Session、自扩展、VS Code/Notion 类比与 Pi 对比

DeepSeek Harness:自进化 Agent、插件运行时,还是 Web 版 VS Code?

最近关于 DeepSeek Harness(下文简称 DSH)的讨论,大致分成两派:一派把它看成「Web 版 VS Code + 会修改自己的 Coding Agent」,另一派把它看成下一代「自进化软件」的雏形。

两边都抓到了一部分,但也都把不同层次的问题混在了一起。

这篇文章只讨论能从仓库、文档和论文直接确认的事实,再区分哪些是合理推断,哪些只是比喻或情绪。

研究基线:2026-08-14。DSH 47f9438,论文 948a07b,Pi 2a9b4eb。DSH 使用的是一份固定并带有本地修改的 Cordis 源码,而不是运行时直接跟随上游最新版;DSH 和 Cordis 都在快速变化,结论应绑定版本阅读。