编码agent这个赛道过去两年的主流做法是往厚了做——更大的系统提示词、更多内置工具、更复杂的编排层,指望用更重的脚手架换更高的跑分。做Pi这套框架的Earendil反着来:系统提示词压到不足1000个token,出厂只装4个工具,赌的是前沿模型本身已经够聪明,不需要那么多预设指令。
Earendil最近发博客拿Databricks的一份基准测试报告当证据,称Pi"整体通过率最高,成本更低"。这份报告叫《Benchmarking Coding Agents on Databricks' Multi-Million Line Codebase》,发布于2026年7月8日。但把Databricks公开的完整数据摊开看,故事没有博客里说的那么干净。
六组数据摊开,通过率其实2胜4负
Earendil博客里唯一给出的具体数字,是Opus 4.8、xhigh推理强度这一组:Pi通过率90%,原生harness Claude Code是88%,Pi成本还便宜1.46倍。听起来像一场碾压。
问题是,Databricks一共测了六组模型和推理强度的组合,Opus 4.8/xhigh只是其中最好看的一组。
| 模型/强度 | Pi通过率 | 原生harness通过率 | Pi成本优势 |
|---|---|---|---|
| Opus 4.8 / xhigh | 90% | 88%(Claude Code) | 1.46倍 |
| Opus 4.8 / high | 85% | 87% | 2.08倍 |
| Opus 4.8 / max | 82% | 83% | 1.20倍 |
| GPT-5.5 / medium | 83% | 80%(Codex) | 1.54倍 |
| GPT-5.5 / high | 81% | 83% | 1.22倍 |
| GPT-5.5 / xhigh | 79% | 80% | 1.44倍 |
六组里,Pi只在两组通过率反超,其余四组打平或略低,差距全部落在3个百分点以内。这和Earendil博客里"vanilla Pi produces industry leading results"的表述有出入——被单独拎出来讲的,恰好是Pi表现最好的那一组。
但另一列数字是干净的:成本优势在六组组合里全部成立,从1.2倍到2.08倍不等,没有一次例外。
Pi真正稳赢的不是准确率,是成本。
省下的钱从哪来
Databricks给出的解释很具体:同一个模型、同一挡推理强度,只换一个harness,任务成本能差出两倍以上,而任务质量基本不变。差异出在上下文管理上——Pi每一轮发送的上下文比原生harness少了大约3倍。
拆到具体数字上:Opus 4.8场景下,Claude Code每个任务中位数要重新塞进742K tokens的上下文,Pi只要236K;GPT-5.5场景下,Codex是1.235M tokens,Pi是665K。
这解释了为什么Pi能在通过率没有全面占优的情况下,还能把成本压下来——它靠的不是模型更懂事,而是把工作集管得更紧,任务用更少轮次收尾。
Shopify的案例,值得留一个问号
Earendil博客里另一个证据来自Shopify。工程师David Cortés只用一句自然语言指令,让Pi自己读扩展文档,写出了一个叫pi-autoresearch的自动优化工具,号称给单元测试提速300倍、React组件挂载提速20%。
这类具体数字目前只出现在Earendil和Shopify工程博客的一面之词里,没有第三方复现。Databricks和Shopify各自的代码库结构、任务类型都是特例,"在这两家公司好用"能不能推广到别的团队,现在还看不清。
真正站得住的是这套哲学本身:Pi不预置这些功能,出厂只给最基础的4个工具,把要不要搭建这些能力的决定权交给用户自己。代价是团队得自己投入工程时间去搭,这部分隐性成本,博客里没有算进去。
- 风险.Databricks和Shopify的benchmark都建立在各自内部工作流上,任务类型和代码库规模是否具有普适性尚未验证,把"两家公司好用"直接当成"适合所有团队"可能是超前判断。
这场"重harness还是轻harness"的分歧,一年前还有另一种说法:原生harness天然占优,因为模型本来就是围着自家工具训练出来的。这个假设正在松动——原文提到,Anthropic把Claude Code的系统提示词砍掉了八成,本身就是一个信号:当模型已经足够擅长直接理解命令行环境,脚手架厚不厚,重要性在下降;上下文花得省不省,重要性在上升。
对要选编码agent的工程团队来说,这份数据给出的操作建议很实在:别只盯着模型跑分,模型加harness的总账才是真实成本,而这笔账里,上下文效率比工具堆得多不多更关键。对Anthropic和OpenAI这类原生harness厂商而言,压力也很具体——通过率没有被彻底压制,但成本效率的差距被摆上了台面,接下来该看它们会不会在token效率上做出回应。
