电脑操作 Agent 一直卡在一个尴尬的中间地带能打的太贵便宜的又不敢用。它干的活其实很具体打开网页填一张又一张的表单把散在几个系统里的数据搬进表格照着文档点一路「下一步」或者接管一台虚拟机跑运维命令。这些事重复、机械、又必须看清屏幕才能做天生适合交给 Agent——前提是它看得懂界面又不会把账单跑穿。拿最常用的 OSWorld 2.0 长任务算笔账。GPT-6 Astra 跑通一个任务折算下来要 9 美元出头Opus 5.5 也要 8.48 美元。单看一个任务不觉得但真实工作流往往要跑几十甚至上百个任务——100 个就是 800 到 900 美元。让智能体连续忙活几个小时账单主要压在输出 token 上这个数是真能肉疼感受到的。便宜那一端更糟。市面上一堆「电脑操作模型」要么只会点鼠标离开屏幕就两眼一抹黑要么分数漂亮但权重不公开你根本不知道那份成绩是跑了多少次、筛了多少次才出来的。9 月 28 号法国的 H 公司开源了 Holo4。一个小得多的模型在这条赛道上追到了闭源旗舰身后成本直接砍到零头。我把权重下下来、harness 跑起来下面是完整实测。它和别的 Agent 模型不太一样Holo4 两个尺寸27B 稠密版还有 35B-A3B 的 MoE 版35B 总参数、3B 激活。两个底座都是从 Qwen 继续训练的。大多数 Agent 模型只练一个界面GUI 模型没了屏幕就是瞎子偏好工具调用的模型到了没有 API 的应用前就卡死。Holo4 不这么干——屏幕点击、打字、写代码跑代码、调 MCP 工具、调业务 API它全会哪个顺手用哪个。同一个模型桌面、网页、安卓、代码沙箱、业务 API 通吃调用方式也不变不用为每个平台换模型。训练方法更能看出这份刻意。官方说监督微调用掉 127B token其中约四分之三来自他们自建的 Agentic Task Factory——一条从文档自动生成可验证任务的流水线桌面占 45%、网页 14%、MCP 和 API 12%、移动端 3%。之后又用异步在线强化学习单独训了两个 LoRA 专家一个管桌面网页、一个管终端 MCP 和 API最后等权融合回主模型。等于把「会点界面」和「会调接口」两套本事并成一个模型。过去一年computer use 一直是各家旗舰的角力场闭源大厂都在推自己的电脑操作能力但开源这边能打的底座一直缺。Holo4 补的就是这个空位一个够小、够便宜、还肯把权重和跑分轨迹全摊开给你的电脑操作模型。官方演示里有两个场景挺说明问题一个是用 FreeCAD 画埃菲尔铁塔复刻四条腿、三层平台、一根塔尖尺寸精确到毫米另一个是 84 次调用、1.3M token 跑完一条完整业务流水线。另一个让我决定写它的点是它的态度权重开源跑分背后每一条 trajectory 也开源。你怀疑某个分数是刷出来的可以自己去 trajectories.hcompany.ai 逐帧回放那次运行看它到底点了哪、卡在哪、错了哪。这种透明程度闭源厂商给不了。这里还有个要提前记住的点27B 分数更高但权重是 research-only 只能研究用真正 Apache 2.0 可商用的是 35B-A3B。后文细说。想了解其他几款的实测数据吗第二部分有完整的对比表格——【关注后查看完整对比】先跑起来一条 API或者一块显卡最省事的是 H Models APIOpenAI 兼容接口注册拿 key 就能调几分钟能跑出首个结果。fromopenaiimportOpenAI clientOpenAI(base_urlhttps://hub.hcompany.ai/v1,# 以官方 quickstart 为准api_keyH_API_KEY,)respclient.chat.completions.create(modelholo4-35b-a3b,messages[{role:user,content:点击「文件」菜单新建一个空白文档}],)print(resp.choices[0].message.content)API 按 token 计价两个尺寸价格不同模型输入缓存读输出协议上下文Holo4-35B-A3B$0.30$0.03$2.00Apache 2.0262KHolo4-27B$0.40$0.04$3.00Research only262K想完全离线跑权重都在 Hugging Face 上给了 BF16、FP8、NVFP4、4-bit GGUF 四种格式。本地起一个 vLLM 服务就能 servepipinstallvllm vllm serve Hcompany/Holo4-35B-A3B --gpu-memory-utilization0.9但模型能跑只是起步。真正让 Holo4「会操作电脑」的是官方那个叫 hai-agents 的 harness它把屏幕截图和工具结果喂给模型再执行模型返回的点击、键入、代码和工具调用循环往复。# hai-agents 的核心循环截图 → 模型决策 → 执行 → 回传forstepinrange(200):framedesktop.screenshot()actionmodel.decide(frame,history)# click / type / code / tool_calldesktop.apply(action)history.append(action)两个接入细节得说一句上下文窗口 262K够装很长的操作历史输入是文本加截图JPEG、PNG、WebP单次最多 5 张图。这层多模态输入是整套循环的地基——模型每一轮都「看着」当前屏幕决策下一步而不是靠历史记录瞎猜。实测分数和成本一起看才算数电脑操作这个方向光看分数没意义得把单任务成本摆在一起。而且要先分清两个基准不少人头一步就混了OSWorld 是短一点的「计算机任务」OSWorld 2.0 是更长的多步工作流后者才是业界公认的硬指标。短任务 OSWorld 上Holo4-27B 拿到 85.2%、单任务才 8 美分35B 也有 80.8%——短跑它已经很能打。但真正见功力的是 OSWorld 2.0 长流程。官方按各家公开价折算成单任务成本摆出来是这样模型OSWorld 2.0 分数通过率单任务成本Opus 5.581.8%48.7%$8.48GPT-6 Astra73.5%–$9.07Holo4-27B61.7%41.5%$1.22Qwen3.8-27B48.0%19.4%$3.49Holo4-35B-A3B30.9%12.3%$0.61这张表读出来就一句话Holo4-27B 用 Opus 5.5 大约七分之一的成本拿到了它四分之三的分数。跟自己的底座 Qwen3.8-27B 比更直观——分数从 48.0% 拉到 61.7%成本还从 3.49 美元降到 1.22 美元微调的效果是双向的既提分又省钱。单任务成本这个口径比 token 单价更接近真实。同一个任务跑得越顺、回路越少吃掉的 token 越少成本自然越低。Holo4 的便宜一半来自单价低另一半来自它不瞎绕弯——同一个任务它所需的调用轮数和输出长度往往比旗舰要短。账要按任务算别只盯着每百万 token 的标价。再看短任务和长任务的落差同一个 27BOSWorld 上 85.2%换到 OSWorld 2.0 长流程只剩 61.7%。这个落差不是 Holo4 独有是所有模型共同的规律——任务链越长、中间每步的误差越会累积分数越往下掉。所以看模型「强不强」不能只盯着短任务的高分得看它在最咬人的长流程上还剩下多少。换个更贴近日常自动化的基准 AutomationBench测的是业务流程自动化这类活儿。Holo4-27B 拿到 45.4%、单任务 5 美分Opus 5 是 50.3%、单任务 3.05 美元。分数差 5 个点成本差了 60 倍。这种性价比放在需要大量批量跑的自动化场景里滚起来差距很大。终端环境也能战。ALE-CLIAgents’ Last Exam 的 Linux 分集105 个任务上Holo4-27B 是 44.1%、单任务 0.82 美元Opus 5.5 是 63.7%、单任务 8.22 美元。分数落后成本又便宜了一个数量级。手机端 AndroidWorld27B 拿了 85.1%35B 是 77.6%。官方自建的 Agentic Task Factory1 万个任务47 个网页应用、14 个 MCP 服务、17 个桌面应用里27B 在 MCP 这一路拿到 89.4%是它单项里最亮眼的数字。这说明它不只是「点鼠标的模型」调工具同样利索。短板也得写清楚其一27B 能打但不能商用。research-only 协议把很多真实业务挡在门外。真正能上线的是 35B-A3B而它在 OSWorld 2.0 长流程上只有 30.9%——任务一复杂分数掉得很明显。其二通过率是另一个照妖镜。OSWorld 2.0 上 Holo4-27B 的 pass rate 是 41.5%比 Opus 5.5 的 48.7% 还差一段。也就是说长任务它能「部分做对」的比例不低但完整跑到底、一次成功的把握闭源旗舰更稳。其三本地部署的门槛别低估。27B、35B 参数不算大但跑通整套 harness 是系统工程——几百步的记忆管理、受控桌面上的 shell、截图来回传递。官方自己也承认为了让 OSWorld 2.0 从个位数爬到 61.7%harness 改了五六轮。这份工程成本不会写进任何价格表。什么时候值得上 Holo4要做大规模、长流程、容错要求高的电脑操作流水线闭源旗舰更稳这个没争议。但下面几类场景Holo4 有真价值预算吃紧还想做电脑操作想把截图和屏幕内容留在本地、不联网想自己微调一个桌面或网页操作底座或者主要靠 MCP/API 调工具、偶尔点一下 GUI 的轻自动化。它的另一个难得之处还是透明——开源了每条基准跑分背后的完整 trajectory你可以逐帧核对它到底怎么点、怎么错。这种透明闭源模型给不了。电脑操作正在从闭源旗舰的专属变成一件能开源、能复现、能自己改的事。Holo4 不是来取代 Opus 5.5 的是把这条赛道的门槛往下压了一档。等它的 DSpark 加速权重覆盖更全、35B 再补一轮长流程分数这事会更有看头。动手建议也直接想先试试就上 35B-A3BApache 2.0、能商用配官方 hai-agents拿一个「打开网页把数据填进表格」这类小自动化练手等把截图循环、记忆管理、几百步的上下文都摸透再谈换 27B 做研究向的压分测试。别一上来就冲着 61.7% 去先把 loop 跑稳。延伸阅读GPT-6 Astra 电脑操作实测 MiniCPM5-2B 端侧模型实测系列文章GPT-6 Astra 电脑操作实测MiniCPM5-2B 端侧模型实测PhysBrain 1.5 物理基座横评全模态模型三强横评如果这篇文章对你有帮助点个关注 我会持续更新 AI 编程实战、工具测评和踩坑记录。