作者:@yaogangqiang · 实验日期:2026-09-12
这是分享文章的实验配套页:结论、过程、逐对结果与复现方法放在一起。下文只统计本次 Astra 的六次正式运行,不合并其他模型或先前的探索实验。
在本次“等待文件出现”的任务里,关闭原生 clock.sleep 后,Astra low 的三个运行都用了更少的模型响应、总输入和输出 token,并且更早回复。
作者:@yaogangqiang · 实验日期:2026-09-12
这是分享文章的实验配套页:结论、过程、逐对结果与复现方法放在一起。下文只统计本次 Astra 的六次正式运行,不合并其他模型或先前的探索实验。
在本次“等待文件出现”的任务里,关闭原生 clock.sleep 后,Astra low 的三个运行都用了更少的模型响应、总输入和输出 token,并且更早回复。
实验类型说明:这是同一个 DSH 版本的机制开关消融,不是实际旧/新版比较。真实版本对照已另做 20 组配对、240 个响应,见新报告。本页 −35.8% 只属于历史消融实验。
开启 DSH 的系统提示词追加机制后,这组实验的整段会话费用估值下降 35.8%,总 Token 却增加 2.4%。 这项优化的收益不能用“少了多少 Token”单独衡量。
同一版 DSH、同一个 Flash 模型,只切换有没有这个机制。主实验为 5 个固定合成业务工作流、30 组配对、60 个六轮会话,共 360 个真实模型响应。完整输出验收:关闭 178/180,开启 179/180。并非零错误,也不足以证明普遍更准确。
费用包含初始输入、续聊、两次规则更新和思考输出,统一按官方峰时价估算,不是实际账单或订阅额度。本轮 low thinking,无工具调用或压缩;结论不直接推广到所有编程任务。
Codex 等待子任务时,为什么还会消耗 token?一次可以自己复现的源码实验
已经验证: 空等待超时后,Codex 会再次请求模型;延长等待仍允许用户输入提前唤醒。
尚未验证: 这些请求具体扣掉多少订阅额度,以及提示词冲突是否导致模型主动频繁轮询。
实验日期:2026-09-08 至 2026-09-09。真实模型调用使用 GPT-6 Astra / low。本 Gist 包含图解、原始实验的脱敏结果、可执行脚本、固定源码链接和复现步骤。无需先懂 Rust;最快的复现只需 Python 和 Codex CLI。
2026-09-09 更新:这次真的调用了 Astra low,也跑了真实子 agent。
先前的 17 次受控运行使用本地 mock;下面新增的是 4 个真实主会话、4 个真实子 agent,共 18 次模型请求。全部从会话日志核验为 Astra low。两轮回答不同的问题,不能混算。
Reproduction for earendil-works/pi#9073, verified against commit e44d75c20a51142abc056c243b13c1d7bb4be687.
The patch adds one regression test to packages/agent/test/harness/jsonl-session-repo.test.ts. It fixes the clock, creates the same explicit ID in two distinct cwd values whose encoded directory names collide, and requires distinct physical paths and cwd-scoped discovery.
From the repository root, with the patch file in that directory:
最近关于 DeepSeek Harness(下文简称 DSH)的讨论,大致分成两派:一派把它看成「Web 版 VS Code + 会修改自己的 Coding Agent」,另一派把它看成下一代「自进化软件」的雏形。
两边都抓到了一部分,但也都把不同层次的问题混在了一起。
这篇文章只讨论能从仓库、文档和论文直接确认的事实,再区分哪些是合理推断,哪些只是比喻或情绪。
研究基线:2026-08-14。DSH
47f9438,论文948a07b,Pi2a9b4eb。DSH 使用的是一份固定并带有本地修改的 Cordis 源码,而不是运行时直接跟随上游最新版;DSH 和 Cordis 都在快速变化,结论应绑定版本阅读。