Claude Code 的系统提示精简了 80%,小模型也能这样搞吗?

Anthropic 最近把 Claude Code 的系统提示(system prompt)砍掉了大约 80%,只用在它们最新的模型上。
这其实很好理解——模型越聪明,需要的指令、约束和示例就越少。一旦模型能力达到某个临界点,示例非但不再有帮助,反而会限制它的发挥。
有意思的是,Anthropic 说这些改动是有数据支撑的——但只针对它们自家的最新模型。接下来自然会追问:这种效果放到低价模型上还行得通吗?小、快、便宜的模型恰恰是最需要手把手指导的那种。按常理,提示减半,这些小模型就该翻车了。
我们替你把实验做了,省得你亲自动手。
实验设计
我们的代理 Ante 提供了一个 --short-prompt 模式:把系统提示整合起来(从约 5.0k 字符压缩到约 2.3k),同时缩短工具描述,这样每次请求的提示总长度从约 34k 字符降到约 18k,几乎砍了一半。
我们用 terminal-bench 2.1(全套 89 个任务),搭配 deepseek-v4-flash——一个真正小、快、便宜的模型,差不多是实际部署代理时能用到的最小规模——做了 A/B 测试。
其他条件全部不变:同一套代理构建、相同的数据集快照、相同的沙箱池、相同的努力级别、相同的参数。两次运行只差一个 CLI 标志。
实验结果
对比 token 时,我们先排除了 20 个通过/未通过结果发生变化的任务,然后比较两个独立中位数。
性能:持平。 短提示实际上还高了 2.3 分,但每任务只跑一次的情况下,这个差距落在噪声区间——老实说就是“没有可测量的差异”。错误次数也完全一样。