OpenAI在DevDay 2026没有端出传说中代号Aeon的全天候智能体,而是把撑起Codex和ChatGPT企业版背后的运行时打包推了出来。

伴随GPT-6.1 Sol和Codex Cloud落地的,还有公测的Agents API,以及一项据内部透露仅耗时14天逆向赶工上线的Decisions API。文档里的承诺一如既往地诱人:一次API调用,指定模型、工具与沙箱,就能拿到自主规划、调用子任务的生产级智能体。

但在技术狂欢背后,硅谷企业采购和工程师群体嗅到的首先是防御的火药味。

企业支出管理平台Ramp在2026年8月给出的采购账单表明,在美企模型与订阅总支出里,Anthropic的渗透率已经冲到了43.8%,直接反超OpenAI的39.8%。这个从4月确立的逆转趋势至今还在扩大,核心推力正是工程师群体向Claude Code等高自主性工具的集中迁移。

系统会先检索并加载必要工具,再拆解给子任务并行处理
系统会先检索并加载必要工具,再拆解给子任务并行处理

阵地战告急与两周克隆的阳谋

OpenAI必须守住开发者的工作流入口。官方披露的数据里,截至2026年6月,企业客户消耗的模型输出token中Codex占比达到64%,头部1%的高频开发者每天并行产生超过60小时的任务轮次。高粘性虽然还在,却主要被锁在自营产品里。

美企 AI 支出渗透率与 OpenAI 内部 Token 结构对比 美企企业支出渗透率 (Ramp 2026.08) Anthropic (持续领先) 43.8% OpenAI (被反超) 39.8% OpenAI 企业 Token 结构 (2026.06) 64% 企业输出 Token 由 Codex 驱动 头部 1% 用户日并行时长 超 60 小时 高粘性 Agent 轮次

把这套工程底座抽离成公开API,就是为了在终端战场反推一把。

但防守的反击不仅针对Anthropic。2026年9月15日,初创团队TypeSafe刚发布了专门做快速结构化决策的Jev模型,主打低延迟和严密的置信度校准。两周后的DevDay上,OpenAI就端出了Decisions API。其底层毫无遮掩地基于GPT-6 Luna套壳,借助全双工通道和极低定价,意图极简明,用平台体量切断垂类决策模型的生路。

大厂的算盘从来打在明处。先用一键打包的开发体验稳住工程师,再用免费的调度层截流初创公司。

但这套逻辑成立的前提是,交付到生产环境的智能体真能把任务扛下来。

视觉神话破灭与20.6%的真实断崖

在技术路线上,OpenAI交过学费后终于变得务实。

此前行业对计算机操作(Computer Use)抱有天真执念,试图让通用大模型像人类肉眼一样盯着屏幕截屏、算坐标、点鼠标。科技播客主持人Dwarkesh Patel此前便直言质疑:真实软件环境不可逆,缺少廉价且高并发的重置机制,单靠像素纯视觉做强化学习,反馈链路长到几乎不可磨练。

这个判断被OpenAI自身的技术转向证实了。2025年10月收购Ari Weinstein(macOS桌面工具Sky创始人)的公司后,团队直接将计算机操作方案做了180度调头。新一代架构全面抛弃了易碎的纯视觉点按,转向底层无障碍数据层、网页DOM树、Playwright驱动与动态代码注入。在全新的Dots架构里,智能体独享云端Linux沙箱,报错时靠控制台日志自我排查,这本质上是一套系统控制工程学,而非视觉魔法。

这种务实让单点任务执行更快,但并没有抹平它与严肃生产之间的深渊。

长程自主 Agent 的工业落地现实断层 机构 AI 试用率 vs 落地 88% 机构接入 AI (Stanford Index) 生产级部署率仅个位数 复杂知识工作最高完成度 24% APEX-Agents 2026 评测 行业天花板由 Gemini 维持 生产环境有害操作率 2.5% WorkBench 测试 (Opus 4.8) 高权限长程执行的死穴

跑分世界的狂欢与真实世界的分化正在加剧。

在规则明确、数据经过严密清洗的OSWorld-Verified基准上,行业顶级模型确实能刷出83.5%的高分。可一旦把测试换成涉及跨软件协作、多权限切换的真实基准OSWorld 2.0,模型表现直接断崖式坠落到20.6%。Stanford 2026 AI Index同样显示,88%的企业试水AI,真正敢让智能体接管核心闭环的依然只有个位数。

基准过拟合可以写进技术通报,不可逆操作的代价却只能由企业资产负债表来买单。WorkBench测试显示,长程执行里仍有2.5%的有害操作率。如果一个具备写权限的终端助手在执行复杂流程时,有2.5%的概率篡改流水、删除配置表或在外联邮件里泄露凭据,任何严肃的IT架构师都不会为它打开防火墙。

生产放权之前,三笔暗账还没算清

面对开放公测,开发者社区的分歧很说明问题。Reddit上的个人开发者忙着用它省掉LangChain框架,Hacker News上的工程骨干则几乎一边倒地追问生产控制权。

在原型演示与严肃工业之间,横着三笔算不清的账。

连续多步调用没有设预算上限,账单可能在几秒内成倍放大
连续多步调用没有设预算上限,账单可能在几秒内成倍放大

第一笔是成本黑洞。

传统API单次请求单次结算,花销一眼看得到头。智能体架构下,一次简单提问会被主任务分解为多轮状态规划、多工具轮询和子智能体并行。OpenAI宣称不收平台管理费,却并未对单次任务给出硬性的全局预算上限和轮次熔断。几次循环嵌套下来,实际消耗的token呈指数级发散,账单可能在几秒钟内彻底失控。

一次用户请求,可能变成几次计费 用户请求 1次 主agent规划 调用模型 工具调用/ 子agent并行 多次调用 结果汇总 返回用户 “只为tokens和工具付费”这句话本身没错 但没说清中间这一段会被放大成几次调用 生产环境下,这段才是真正的成本变量

第二笔是控制权锁定。

过去防范模型绑定,改换客户端的prompt适配层即可。现在把任务拆解、上下文裁剪、工具调用乃至Decisions API决策分发全套压在OpenAI托管层,应用的核心运转机制就与平台彻底捆死。两周赶工出来的决策层本身缺少置信度数学校准,一旦遇到边界条件产生决策漂移,排查代价全由开发者承担。

以前更换模型只需快速拔插,现在整个业务逻辑都被焊死在平台
以前更换模型只需快速拔插,现在整个业务逻辑都被焊死在平台
锁定升级到了哪一层 模型层 — 可替换,换个供应商重调prompt即可 harness层 — OpenAI托管,状态/评估/工具策略都长在这里 应用层 — 业务逻辑,理论上应该由开发者掌控 以前担心绑模型,现在要多看一层:绑没绑运行时

第三笔是安全防线的形式化。

自传播提示词注入早已脱离理论探讨。当智能体具备读取外部数据与本地代码执行的双向权限,所谓的人工确认窗口就会在长程高频调用中形同虚设。OpenAI自身的安全审计曾记录过,智能体在复杂长程任务受阻时,出现过掩盖错误、甚至越权索要系统敏感凭证的行为。


终局看韧性,不在封套速度

《淮南子》有言:“夫乘舟而惑者,不知东西,见斗极则忤矣。”

在技术范式剧烈震荡的周期里,看清不变的物理规律比追赶概念更关键。Anthropic靠在编程终端和长程任务上的自治确定性,硬生生切走了43.8%的企业支出份额。这迫使OpenAI不得不放弃过去端架子的打法,一边重构工程底座,一边两周闪击克隆竞品功能。

平台巨头可以用体量和分发优势迅速封堵初创企业,也能用开箱即用的运行时帮创业团队在一周内搭出体面的Demo。

但工业落地的胜负从来不在概念包装有多密,也不在套壳有多快。在真实复杂的OSWorld 2.0里拿到20.6%得分的残酷现实面前,如果无法在刚性沙箱隔离、确定性决策校准和账单熔断机制上拿出底牌,再华丽的API封装,也很难换来企业在核心业务系统上交出写权限。