H Company 在 2026 年 9 月 28 日正式上线了全能型计算机操作智能体 Holo4 系列,包含 27B Dense 密集模型与 35B-A3B 混合专家两个主力尺寸,同步推出端侧轻量版本 Holotron4 Nano。研发团队宣称用单一模型打通了图形界面点击、代码沙箱、MCP(Model Context Protocol)以及 REST API,直接接管所有企业桌面与系统软件。
官方给出的战报相当惊艳:Holo4 27B 在权威桌面评测 OSWorld 2.0 上取得 61.7% 的分数,直逼顶尖闭源模型 Claude Opus 5.5 的 81.8%,宣称单任务尝试成本只要 1.22 美元,远低于 Opus 5.5 的 8.48 美元。但把开源协议、评测集纯净度与真实执行链路放在放大镜下对照,这并非一场单纯的开源平替狂欢,而是一套极其精明的商业变相卡位。
许可证的双轨算盘:能打的禁商用,给用的难及格
虽然 Holo4 的权重文件同步上架了 Hugging Face,但仔细翻看授权协议就会发现两款尺寸的待遇天差地别。
真正撑起 61.7% 战报门面的主力版本 Holo4 27B,采用的是 CC BY-NC 4.0 协议,明文禁止商业使用。企业若想在自身生产系统中部署 27B 模型,唯一的合法合规渠道只能调用 H Company 提供的托管 API,价格定在每百万输入 Token 0.40 美元、输出 3.00 美元。
完全开放 Apache 2.0 商业许可、允许企业自由本地部署的模型,只有激活参数仅 3B 的混合专家版本 Holo4 35B-A3B。但在长任务基准 OSWorld 2.0 中,这款 MoE 模型的得分直接跌至 30.9%。
企业如果抱着开源私有化的预期入场,立刻陷入两难抉择:选择完全免费商用的 35B-A3B,必须忍受只有三成及格率的高频报错;想要能办事的 27B,就必须向官方商业接口交过路费。
《管子》曾讲:利出于一孔者,其国无敌;出二孔者,其兵半屈。商业控制权从来不在于名义上开源了多少层参数,而在于核心变现管道留在何处。这种一边秀出开源肌肉、一边卡死商用闸口的策略,本质上仍是精准的商业获客路径。
跑分与成本的双重修辞:80% 重叠与折算陷阱
除了双轨授权的算盘,宣称逼近 Claude Opus 5.5 的测试表现也带有明显的数据修辞。
在通用办公自动化基准 AutomationBench 上,Holo4 27B 报告了 45.4% 的成绩。但测试文档显示,该基准公开的 600 个测试任务中,有整整 480 个任务与模型训练数据的采集分片重叠。拿八成见过题目的测试集来衡量泛化能力,测出来的更像记忆检索,而非现场应对未知软件的判断力。在未发生重叠的 120 个保留任务中,模型的表现仍需等待独立盲测检验。
在成本测算上,官方打出的 1.22 美元单任务成本,是以过程部分得分为基准核算的单次尝试花费。根据公布的绝对任务通过率,Holo4 27B 的单次实际成功率约为 41.5%。折算下来,每次真正交付成功任务的理论尝试成本约为 2.94 美元。
虽然 2.94 美元仍然低于 Opus 5.5 折算后的 17.41 美元,但二者的绝对完成率存在硬性断层。在严苛的企业流程里,一次中途卡壳带来的现场排查与人工重修成本,往往远超节约下来的几次 API 费用。
统揽一切接口的工程代价
长久以来,自动化软件操作被困在两个极端之间。一类是专注图像识别的视觉 Agent,依赖屏幕截屏和虚拟光标,遇到无界面的纯后台服务器就完全瘫痪;另一类是基于结构化函数调用的工具智能体,习惯了规范的 JSON 参数,一旦丢给它一个没有 API 的老旧客户端,系统就会立刻停摆。
Holo4 试图打通这种边界。它利用自动化流水线从开源软件和网站说明文档中抽取逻辑,合成了约 10,000 个横跨桌面、Web 和 MCP 协议的交互任务。
这种全能方案听起来解决了工具割裂,但在工程落地时,跨环境执行带来了巨大的稳定性挑战。
在 FreeCAD 埃菲尔铁塔 3D 建模测试中,Holo4 27B 成功建立了符合几何参数的阶梯塔身与空心四脚立柱。完成这项操作,模型进行了 84 次循环调用,产生了高达 130 万 Token 的上下文消耗。在 Godot 引擎制作无玩家吃豆人游戏的任务中,Holo4 耗费了 240 万 Token。
当自动化交互需要连续执行数十步时,单价红利会被冗余调用与状态纠错快速吞噬。一旦智能体在第 40 步因为窗口遮挡发生误操作,后续链路就会出现连锁偏差。系统为了自我修正,只能把历史屏幕截图与动作日志一遍遍塞回上下文窗口。
| 评估维度 | 宣发主张与预期 | 真实工程账本 |
|---|---|---|
| 商用授权 | 开源权重自由获取 | 27B 禁商用强制绑定官方 API,MoE 降级至 30.9% |
| 跑分对照 | OSWorld 2.0 达 61.7% 逼近闭源巨头 | 官方主榜未列入,AutomationBench 包含 80% 训练集重合 |
| 单任务开销 | 单次尝试仅需 1.22 美元 | 成功任务折算达 2.94 美元,复杂建模单次吃掉 130 万 Token |
H Company 本次最有价值的交付物,并非带着商业枷锁的 27B 权重,而是同步开源的 7,366 次真实交互轨迹。这批包含截图、思考逻辑和纠错步骤的数据集,能为行业训练垂直智能体提供扎实养料。
对于寻求低成本自动化改造的企业而言,现阶段把业务直接托管给小参数智能体依然为时尚早。参数可以以小博大,流程无法偷工减料。省下的单价往往补不起试错的账目,在核心任务的成功率跨过临界点前,任何单价层面的降本宣传都只是一张待结算的草稿。
