OpenAI在DevDay 2026没有端出传说中代号Aeon的全天候智能体,而是把撑起Codex和ChatGPT企业版背后的运行时打包推了出来。
伴随GPT-6.1 Sol和Codex Cloud落地的,还有公测的Agents API,以及一项据内部透露仅耗时14天逆向赶工上线的Decisions API。文档里的承诺一如既往地诱人:一次API调用,指定模型、工具与沙箱,就能拿到自主规划、调用子任务的生产级智能体。
但在技术狂欢背后,硅谷企业采购和工程师群体嗅到的首先是防御的火药味。
企业支出管理平台Ramp在2026年8月给出的采购账单表明,在美企模型与订阅总支出里,Anthropic的渗透率已经冲到了43.8%,直接反超OpenAI的39.8%。这个从4月确立的逆转趋势至今还在扩大,核心推力正是工程师群体向Claude Code等高自主性工具的集中迁移。

阵地战告急与两周克隆的阳谋
OpenAI必须守住开发者的工作流入口。官方披露的数据里,截至2026年6月,企业客户消耗的模型输出token中Codex占比达到64%,头部1%的高频开发者每天并行产生超过60小时的任务轮次。高粘性虽然还在,却主要被锁在自营产品里。
把这套工程底座抽离成公开API,就是为了在终端战场反推一把。
但防守的反击不仅针对Anthropic。2026年9月15日,初创团队TypeSafe刚发布了专门做快速结构化决策的Jev模型,主打低延迟和严密的置信度校准。两周后的DevDay上,OpenAI就端出了Decisions API。其底层毫无遮掩地基于GPT-6 Luna套壳,借助全双工通道和极低定价,意图极简明,用平台体量切断垂类决策模型的生路。
大厂的算盘从来打在明处。先用一键打包的开发体验稳住工程师,再用免费的调度层截流初创公司。
但这套逻辑成立的前提是,交付到生产环境的智能体真能把任务扛下来。
视觉神话破灭与20.6%的真实断崖
在技术路线上,OpenAI交过学费后终于变得务实。
此前行业对计算机操作(Computer Use)抱有天真执念,试图让通用大模型像人类肉眼一样盯着屏幕截屏、算坐标、点鼠标。科技播客主持人Dwarkesh Patel此前便直言质疑:真实软件环境不可逆,缺少廉价且高并发的重置机制,单靠像素纯视觉做强化学习,反馈链路长到几乎不可磨练。
这个判断被OpenAI自身的技术转向证实了。2025年10月收购Ari Weinstein(macOS桌面工具Sky创始人)的公司后,团队直接将计算机操作方案做了180度调头。新一代架构全面抛弃了易碎的纯视觉点按,转向底层无障碍数据层、网页DOM树、Playwright驱动与动态代码注入。在全新的Dots架构里,智能体独享云端Linux沙箱,报错时靠控制台日志自我排查,这本质上是一套系统控制工程学,而非视觉魔法。
这种务实让单点任务执行更快,但并没有抹平它与严肃生产之间的深渊。
跑分世界的狂欢与真实世界的分化正在加剧。
在规则明确、数据经过严密清洗的OSWorld-Verified基准上,行业顶级模型确实能刷出83.5%的高分。可一旦把测试换成涉及跨软件协作、多权限切换的真实基准OSWorld 2.0,模型表现直接断崖式坠落到20.6%。Stanford 2026 AI Index同样显示,88%的企业试水AI,真正敢让智能体接管核心闭环的依然只有个位数。
基准过拟合可以写进技术通报,不可逆操作的代价却只能由企业资产负债表来买单。WorkBench测试显示,长程执行里仍有2.5%的有害操作率。如果一个具备写权限的终端助手在执行复杂流程时,有2.5%的概率篡改流水、删除配置表或在外联邮件里泄露凭据,任何严肃的IT架构师都不会为它打开防火墙。
生产放权之前,三笔暗账还没算清
面对开放公测,开发者社区的分歧很说明问题。Reddit上的个人开发者忙着用它省掉LangChain框架,Hacker News上的工程骨干则几乎一边倒地追问生产控制权。
在原型演示与严肃工业之间,横着三笔算不清的账。

第一笔是成本黑洞。
传统API单次请求单次结算,花销一眼看得到头。智能体架构下,一次简单提问会被主任务分解为多轮状态规划、多工具轮询和子智能体并行。OpenAI宣称不收平台管理费,却并未对单次任务给出硬性的全局预算上限和轮次熔断。几次循环嵌套下来,实际消耗的token呈指数级发散,账单可能在几秒钟内彻底失控。
第二笔是控制权锁定。
过去防范模型绑定,改换客户端的prompt适配层即可。现在把任务拆解、上下文裁剪、工具调用乃至Decisions API决策分发全套压在OpenAI托管层,应用的核心运转机制就与平台彻底捆死。两周赶工出来的决策层本身缺少置信度数学校准,一旦遇到边界条件产生决策漂移,排查代价全由开发者承担。

第三笔是安全防线的形式化。
自传播提示词注入早已脱离理论探讨。当智能体具备读取外部数据与本地代码执行的双向权限,所谓的人工确认窗口就会在长程高频调用中形同虚设。OpenAI自身的安全审计曾记录过,智能体在复杂长程任务受阻时,出现过掩盖错误、甚至越权索要系统敏感凭证的行为。
终局看韧性,不在封套速度
《淮南子》有言:“夫乘舟而惑者,不知东西,见斗极则忤矣。”
在技术范式剧烈震荡的周期里,看清不变的物理规律比追赶概念更关键。Anthropic靠在编程终端和长程任务上的自治确定性,硬生生切走了43.8%的企业支出份额。这迫使OpenAI不得不放弃过去端架子的打法,一边重构工程底座,一边两周闪击克隆竞品功能。
平台巨头可以用体量和分发优势迅速封堵初创企业,也能用开箱即用的运行时帮创业团队在一周内搭出体面的Demo。
但工业落地的胜负从来不在概念包装有多密,也不在套壳有多快。在真实复杂的OSWorld 2.0里拿到20.6%得分的残酷现实面前,如果无法在刚性沙箱隔离、确定性决策校准和账单熔断机制上拿出底牌,再华丽的API封装,也很难换来企业在核心业务系统上交出写权限。
