科技行业向来喜欢给技术演进贴上宏大的预言标签。最近有报道把 Meta、OpenAI 和 Uber 捆绑在一起,宣称它们教会了 AI Agent 主动开口说话。然而公开检索并未发现三家联合发布过任何名为 Initiative 的基准或论文;现实情况恰恰相反,在经历早期的主动性冲动后,各家正在为打扰成本与系统越权买单,并在工程落地上全面收缩。
褪去光环的巨头实践
OpenAI 曾于 2025 年 9 月 25 日推出过主动研究功能 ChatGPT Pulse,但这项看似激进的尝试已在 2026 年 6 月 17 日被宣布下线。主动更新能力没有无限扩张,而是被收拢进需要用户明确授权的 Scheduled Tasks 框架下。
Meta 的步子迈得同样克制。2026 年 7 月 24 日,Meta AI 仅在部分市场上线了基于显式设置的循环任务与日程简报。尽管 2025 年的泄露文件表明其 AI Studio 曾对 14 天内交互满 5 次的高频用户测试过单次主动唤醒,但后续并未普遍推开。
至于 Uber,其在 2026 年 5 月 21 日发布的《Solving the Identity Crisis for AI Agents》白皮书,核心完全落在 Agent 身份认证、委托授权以及 MCP 网关与 OpenAI 的集成,这是一套防御性的底层工程基建,而非预测用户意图的无端主动交互。即使是其购物车助手 Cart Assistant,依然牢牢绑定在用户选定商店或提交清单之后的既定流程中。
- 结论.主流厂商并未在通用主动交互上达成技术突破,反而一致退守到规则明确、边界受限的窄域场景中。
实验室指标与现实水位的落差
模型侧的理论能力看似跑在前面,但在现实任务中依然举步维艰。
从学术基准来看,ICLR 2025 论文中的 ProactiveBench 包含 6790 个训练事件与 233 个测试事件。在该基准下,微调后的 Qwen2-7B 取得了 66.47% 的 F1 值,微调 Llama-3.1-8B 取得 66.25%,而未经微调的基线 Llama-3.1-8B 仅有 55.06%。
但在面向真实复杂环境的端到端评估中,情况要残酷得多。PROBE 主动问题解决基准(2025 年 10 月 22 日提交,2026 年 7 月 7 日修订)专门测试智能体在用户未明确指出具体问题时的发现与解决能力。在这个测试集上,行业顶尖的 GPT-5 与 Claude Opus 4.1 均仅仅录得 40% 的端到端解决率。
离线分类识别的 F1 值无法直接兑现为生产环境的可用性。对于主动交互系统而言,在办公室开会或深夜睡眠时发起一次毫无价值的误报弹窗,对用户体验造成的伤害,远非提供一次恰到好处的边际建议所能弥补。
沉默的设计哲学与干预梯度
决定何时闭嘴,远比学会何时开口复杂。学术界已逐步将主动干预抽象为序列决策问题,并给出了分层的决策梯度。一个成熟的 Agent 系统不应在沉默与全盘接管之间做二元跳跃,而应当依循明确的控制逻辑分级行事。
在这一梯度中,大多数场景的最优解其实停留在保持沉默与静默准备。系统在后台组织好上下文,却不触发震动或前台气泡,直到用户主动调起时再呈现结果。
- 风险.跳过中间授权阶段直接推进无感执行,必然导致注意力侵蚀与误操作连带责任,当前工业界在打扰恢复延迟(resumption lag)评估上仍缺乏公认标准。
古人讲大音希声,大象无形。这套哲学同样适用于今日的软件工程。AI 的自主性并不体现在每隔半小时跳出来展示一次存在感;真正可靠的技术往往隐于幕后,把触发权限归还给用户,在边界之内把准备做到极致,在被唤醒之前安于不言。
