H Company 开源 Holo4:跑分压过 GPT-5.5,但能商用的那版只剩一半水平

Holo4 计算机操作智能体同时操作图形界面、代码终端与接口调用的主题插图
内容摘要

H Company 开源计算机操作智能体 Holo4:27B 版在桌面操作评测里拿到 85.2%、单任务只要八美分,但开源权重标着非商用许可;真正能商用的那版在长流程任务上分数腰斩。本文拆解跑分口径、许可陷阱、上手步骤与替代方案。

H Company 在 9 月 28 日放出 Holo4,一组”计算机操作智能体”(computer-use agent)模型,权重直接开源到 Hugging Face。最抓人的数字是:27B 的密集版在桌面操作评测 OSWorld 上拿到 85.2%,跑分压过 GPT-5.5 的 78.7%,单任务成本只有 0.08 美元。

但这份公告里藏着一个大部分人不会注意到的分歧:分数最好那版的权重标着非商用许可,能商用的那版在长流程任务上只有它一半的水平。

事实梳理:Holo4 发了什么

Holo4 一次放出一个家族,不是单个模型:

  • Holo4-27B:密集(dense)模型,基于 Qwen3.8-27B 架构改造,视觉语言模型,上下文 262,144 token(官方对外说 256K)。
  • Holo4-35B-A3B:混合专家(MoE)模型,总参数 35B,每步只激活约 3B。
  • Holotron4 Nano:30B-A3B,基于英伟达 Nemotron 3 Nano Omni 训练,属于 NVIDIA Nemotron Coalition 的合作产出。

和大多数”只会点屏幕”或者”只会调接口”的智能体不同,Holo4 主打一个模型横跨所有界面:看截图点击打字、自己写代码并运行、调 MCP 服务器和 REST 接口。同一套模型跑在桌面、网页、安卓、代码沙箱和业务接口上,不用按平台换模型。

权重以 BF16、FP8、NVFP4 和 4-bit GGUF 四种格式发布,可以用 Transformers、vLLM、SGLang 或 Docker 起服务,本地机器也能挂 llama.cpp;同时提供托管接口,地址在 hub.hcompany.ai。

跑分要看两个榜:OSWorld 和 OSWorld 2.0 不是一回事

官方给的表格里有两组容易看混的数字,得分开读。

短任务(OSWorld,考”能不能点对地方”):

  • Holo4-27B:85.2%,单任务 0.08 美元
  • Holo4-35B-A3B:80.8%,单任务 0.05 美元
  • 底座 Qwen3.8-27B:84.3%,单任务 0.22 美元
  • 同榜对照:Qwen3.8 Max 86.1%、Fable 5 86.0%、GPT-5.5 78.7%

长流程(OSWorld 2.0,考”一串步骤能不能走完”):

  • Holo4-27B:61.7% 部分分,单任务 1.22 美元(严格成功率 41.5%)
  • Holo4-35B-A3B:30.9%,单任务 0.61 美元
  • Opus 5.5:81.8%,单任务 8.48 美元
  • GPT-6 Astra:73.5%,单任务 9.07 美元
  • Qwen3.8-27B:48.0%,单任务 3.49 美元

这里有个必须说清的坑:OSWorld 2.0 只有 108 个长任务,官方说明其中位任务让熟练的人手工做要约 1.6 小时,而且这个榜单同时记录”部分分”和”严格完成”。61.7% 是部分分,不等于六成任务跑通——严格完成率是 41.5%,差了整整 20 个百分点。把它当”完成度”读会严重高估。

另外还有几个榜单:AndroidWorld 分别 85.1% 和 77.6%;AutomationBench v1.0.6 是 45.4% 和 34.5%;Agents’ Last Exam 的 Linux 分卷(ALE-CLI,105 题)是 44.1% 和 30.9%。在公司内部用 Agentic Task Factory 生成、没进过训练的题目上,27B 在网页任务上 80.2%、MCP 任务 89.4%、桌面任务 72.0%。

还有一个口径问题:AutomationBench 公开集 600 道题里有 480 道落在它收集训练数据的范围内,真正留出的 120 道题上,27B 是 49.3%、MoE 版是 31.7%。公开集分数和留出集分数不是一回事。

同时,官方自己标注了对照口径的差异:Holo4 的分数跑在自家 harness 上(部分榜单为单次运行),而 Opus 5.5、GPT-6 Astra 这些对照点是各厂商模型卡、官方榜单和图表上的数字,测试环境与 effort 档位都不同。

开源是真的,但许可要看清

这是这篇文章我最想说的一点。

Holo4 被宣传成”开放权重”。翻模型卡会看到更具体的说法:

  • Holo4-35B-A3B 是 Apache 2.0,可以放进产品里商用。
  • Holo4-27B 是 CC BY-NC 4.0,也就是非商用许可,只能用于研究。

问题在于,27B 才是分数好的那版:长流程 61.7% 对 30.9%,是 MoE 版的两倍。如果你要做一个商用产品,你能合法用的那版,水平只有一半。公告本身没有把这个分歧说得很重。

接口定价也是按这个分的:35B-A3B 是每百万输入 0.30 美元、缓存 0.03 美元、输出 2.00 美元;27B 是输入 0.40 美元、缓存 0.04 美元、输出 3.00 美元——27B 在官方口径里标着 research-only。

所以选型时的动作很简单:看具体那个仓库的 LICENSE 文件,而不是看”某家族是开源的”这个说法。

它是怎么练出来的

官方披露的训练流程里有几个值得记的点:

  • 监督微调用了 127B token,其中约四分之三是成功的智能体轨迹,按环境分:桌面 45%、网页 14%、MCP 与接口 12%、移动端 3%,剩下的是多模态推理、界面定位和纯文本的工具调用与写代码。
  • 之后做长任务的异步在线强化学习,训出两个专项 LoRA 专家(一个管桌面和网页,一个管终端、MCP 与接口),再等权合并回去,合并后不再训练。
  • 训练数据来自内部的 Agentic Task Factory,官方说目前生成约一万道任务:网页应用约 4000 道、MCP 服务器与桌面环境各约 3000 道,还包括”同一状态既能点界面又能调接口”的混合环境。
  • harness 也重做过:支持跨几百步的持久记忆,以及直接在桌面机上开 shell。

还有一点挺实在:它把公开榜单上的每一条轨迹都放出来了,可以在线回放,也能从 Hugging Face 下数据集。这比只发一个分数强——你可以自己看它在哪一步开始跑偏。

上手:先本地跑还是先调接口

想动手的话,顺序建议这样:

  1. 先确认你要哪一版。 只是研究、内部工具、自己玩玩,选 27B(分数高);要做产品,从 35B-A3B 起步(Apache 2.0)。
  2. 拉权重,选一个推理后端。 BF16 或 FP8 走 vLLM / SGLang;显存紧就上 4-bit GGUF + llama.cpp;只想快速验证就先别装环境,直接用托管接口。
  3. 接上外层 harness。 模型本身只输出”点哪里、敲什么、调哪个工具”,真正执行的是外层 harness(官方用的是 hai-agents)。自己搭也可以,但这部分直接决定长任务的稳定性。
  4. 按你的真实任务建一小组测试题。 别只看公开榜。挑十个你日常真在做的流程,比如跨系统录单、对账、工单分派,记录成功率、平均步数和单任务成本,再和闭源模型比。
  5. 算”每件完成的活”的成本,不是每百万 token 的价格。 长任务的 token 消耗会成倍放大:官方在搭一个吃豆人小游戏的任务上用了 240 万 token,底座 Qwen3.8-27B 在同一任务上是 1140 万 token。这类差异会直接决定账单。

如果你还在挑”用哪个智能体干活”,可以先看 AI 智能体与自动化专题页 和 AI 工具评测专题页 里已经整理过的工具与场景,再决定要不要自建。

优缺点

优点:

  • 一个模型同时吃下界面、代码、MCP 和接口四类操作,混合型流程不用再串两个模型
  • 27B 在短任务榜单上确实是一线水平,成本极低(单任务 0.08 美元)
  • 权重真放出来了,四种量化格式齐全,本地可跑
  • 公开榜单的轨迹全部公开可回放,这在开源模型里很少见
  • 有 Apache 2.0 的商用版本,不是只有一个”研究专用”的摆设

缺点:

  • 分数最好的 27B 是非商用许可,商用只能用分数腰斩的 MoE 版
  • 长流程能力和顶级闭源模型差距明显(61.7% 对 81.8%)
  • 部分分与严格完成率容易混淆,宣传口径偏乐观
  • 公开集与留出集分数差异不小,部分榜单存在训练数据重叠
  • 长任务成本优势会被 token 消耗吃掉一部分,而且对照组跑的是自家 harness
  • 本地部署对硬件仍有要求,官方没给自托管硬件指引

适合谁用、谁先别急

适合: 有自己服务器、要自动化桌面软件的内部工具团队,比如订单录入、工单分派、跨老系统对账;预算敏感、愿意用工程投入换模型成本的小团队;做智能体研究、需要可回放轨迹的人。

先别急: 要商用又要最高分的人(许可不满足);一步错就出大事故的流程(41.5% 的严格完成率还撑不起);想”装上就自动干活”的人(harness 和执行层仍要自己搭)。

替代方案

  • 等闭源模型降价。 长流程这条线上 Opus 5.5 仍是 81.8%,如果本地跑不动、许可又卡着,按量付费反而更划算,参考我们此前记录的 同日降价那一轮。
  • 走”沙盒基础设施”路线。 如果难点在”让智能体安全地乱试”,DeepSeek 那套一天造三百万个沙盒的 DSec 平台思路 更值得抄。
  • 用能力强但会越界的模型时,先把边界定好。 上个月 OpenAI 自家智能体靠 DNS 溜出沙盒那件事就是提醒,那次的处置时间线 值得读一遍。
  • 纯编程场景不必上计算机操作模型。 只写代码、跑命令的话,中端编程模型已经够用且更便宜,见 Claude Sonnet 5.5 的成本口径。

老达点评

第一,这次真正值钱的不是分数,是”一个模型横跨界面”。 现在多数智能体模型只擅长一种入口:只会看屏幕的,在没有界面的地方寸步难行;只会调工具的,碰上没有接口的老系统就卡死。真实业务恰恰是两头混着的。Holo4 把这件事做进同一个模型里,方向是对的。

第二,开源公告要配着模型卡读。 “开放权重”不等于”你能拿去商用”。这次分数最好的那版是非商用许可,能商用的那版只有一半水平,公告不会主动把这个矛盾摆进标题。国内团队如果打算基于它做产品,第一件事是点开对应仓库的 LICENSE,而不是看新闻稿。

第三,便宜要按”每件完成的活”算。 短任务上 0.08 美元确实便宜得离谱,但长流程上 1.22 美元对 Opus 5.5 的 8.48 美元,换来的是 20 个百分点的能力差距。这笔账划不划算,取决于你的任务错了能不能重来——能重来的活,便宜就有意义。

第四,部分分这个坑,值得所有看跑分的人记住。 61.7% 和 41.5% 是同一次运行的两个口径。厂商选对自己有利的那个讲,是常规操作;读的人自己分清楚,才是本事。

一句话总结:Holo4 把”计算机操作智能体”往正确方向推了一步,但现阶段它更像”预算有限、能容忍失败率的内部自动化”的选择,而不是”替代顶级闭源模型”的答案。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *