编码agent这个赛道过去两年的主流做法是往厚了做——更大的系统提示词、更多内置工具、更复杂的编排层,指望用更重的脚手架换更高的跑分。做Pi这套框架的Earendil反着来:系统提示词压到不足1000个token,出厂只装4个工具,赌的是前沿模型本身已经够聪明,不需要那么多预设指令。

Earendil最近发博客拿Databricks的一份基准测试报告当证据,称Pi"整体通过率最高,成本更低"。这份报告叫《Benchmarking Coding Agents on Databricks' Multi-Million Line Codebase》,发布于2026年7月8日。但把Databricks公开的完整数据摊开看,故事没有博客里说的那么干净。

六组数据摊开,通过率其实2胜4负

Earendil博客里唯一给出的具体数字,是Opus 4.8、xhigh推理强度这一组:Pi通过率90%,原生harness Claude Code是88%,Pi成本还便宜1.46倍。听起来像一场碾压。

问题是,Databricks一共测了六组模型和推理强度的组合,Opus 4.8/xhigh只是其中最好看的一组。

模型/强度Pi通过率原生harness通过率Pi成本优势
Opus 4.8 / xhigh90%88%(Claude Code)1.46倍
Opus 4.8 / high85%87%2.08倍
Opus 4.8 / max82%83%1.20倍
GPT-5.5 / medium83%80%(Codex)1.54倍
GPT-5.5 / high81%83%1.22倍
GPT-5.5 / xhigh79%80%1.44倍

六组里,Pi只在两组通过率反超,其余四组打平或略低,差距全部落在3个百分点以内。这和Earendil博客里"vanilla Pi produces industry leading results"的表述有出入——被单独拎出来讲的,恰好是Pi表现最好的那一组。

但另一列数字是干净的:成本优势在六组组合里全部成立,从1.2倍到2.08倍不等,没有一次例外。

Pi真正稳赢的不是准确率,是成本。

省下的钱从哪来

Databricks给出的解释很具体:同一个模型、同一挡推理强度,只换一个harness,任务成本能差出两倍以上,而任务质量基本不变。差异出在上下文管理上——Pi每一轮发送的上下文比原生harness少了大约3倍。

拆到具体数字上:Opus 4.8场景下,Claude Code每个任务中位数要重新塞进742K tokens的上下文,Pi只要236K;GPT-5.5场景下,Codex是1.235M tokens,Pi是665K

每任务中位数重新输入的上下文 Claude Code(Opus场景) 742K Pi(Opus场景) 236K Codex(GPT-5.5场景) 1.235M Pi(GPT-5.5场景) 665K 上下文越少,重新预填的算力开销越低,成本越省

这解释了为什么Pi能在通过率没有全面占优的情况下,还能把成本压下来——它靠的不是模型更懂事,而是把工作集管得更紧,任务用更少轮次收尾。

Shopify的案例,值得留一个问号

Earendil博客里另一个证据来自Shopify。工程师David Cortés只用一句自然语言指令,让Pi自己读扩展文档,写出了一个叫pi-autoresearch的自动优化工具,号称给单元测试提速300倍、React组件挂载提速20%。

这类具体数字目前只出现在Earendil和Shopify工程博客的一面之词里,没有第三方复现。Databricks和Shopify各自的代码库结构、任务类型都是特例,"在这两家公司好用"能不能推广到别的团队,现在还看不清。

真正站得住的是这套哲学本身:Pi不预置这些功能,出厂只给最基础的4个工具,把要不要搭建这些能力的决定权交给用户自己。代价是团队得自己投入工程时间去搭,这部分隐性成本,博客里没有算进去。

  • 风险.Databricks和Shopify的benchmark都建立在各自内部工作流上,任务类型和代码库规模是否具有普适性尚未验证,把"两家公司好用"直接当成"适合所有团队"可能是超前判断。

这场"重harness还是轻harness"的分歧,一年前还有另一种说法:原生harness天然占优,因为模型本来就是围着自家工具训练出来的。这个假设正在松动——原文提到,Anthropic把Claude Code的系统提示词砍掉了八成,本身就是一个信号:当模型已经足够擅长直接理解命令行环境,脚手架厚不厚,重要性在下降;上下文花得省不省,重要性在上升。

对要选编码agent的工程团队来说,这份数据给出的操作建议很实在:别只盯着模型跑分,模型加harness的总账才是真实成本,而这笔账里,上下文效率比工具堆得多不多更关键。对Anthropic和OpenAI这类原生harness厂商而言,压力也很具体——通过率没有被彻底压制,但成本效率的差距被摆上了台面,接下来该看它们会不会在token效率上做出回应。