产品化 AI 助理都卷成这样了我们还有必要自己搭 OpenClaw / Hermes / DeepSeek Harness 吗AI-FDE 奇点于 2026-09-30 发布OpenClaw/DeepSeek/AI Agent/开源框架/技术选型导读9 月的最后三周OpenClaw、Meta Muse、Manus 2.0、OpenAI Dots 先后落地AI 助理拿齐了电脑、记忆、身份、长期任务四件套。同一时间开源侧也在加速OpenClaw、Hermes Agent、DeepSeek Harness 三个自建方案各自跑出了不同路径。于是最现实的问题来了——既然产品化助理已经这么强还有必要自己搭一套吗这篇不给你答案。只做三件事把三个自建方案的差异摊开、把两边的账本都算一遍、把真正该吵的问题摆到桌面上。结论留给你也留给评论区。 目录01 先把牌摊开三个“自建方案”三种完全不同的赌注02 三个反直觉的发现03 产品化那一侧到底给了什么04 真正的分歧不在“要不要自建”05 两本账算出来是相反的结论06 一个可以立刻用的检验法 07 留给评论区的六个问题01 先把牌摊开三个自建方案三种完全不同的赌注先说一个采访式的观察问“选 OpenClaw 还是 Hermes”的人往往还没想清楚自己要解决什么问题。因为这三个项目压根不在同一条赛道上。维度OpenClawHermes AgentDeepSeek Harness (DSH)出身2025 年出道社区项目Nous Research2026-02-25 开源DeepSeek 官方2026-08-13 发布语言栈TypeScript / Node 22PythonTypeScriptLicenseMITMITMIT一句话本质多通道 AI 网关 运行时自进化单体 Agent可嵌入的 Agent 运行时线束设计重心触达 / 网关学习 / 记忆运行时 / 可组合进程模型分布式Gateway Client Node单机单体单进程多 Agent 预设并存扩展模型核心自有、capability 外扩纯鸭子类型插件一切皆插件连核心可换状态与审计session transcript LCM 压缩SQLite FTS5 三层记忆不可变事件流可回放触达通道30 消息通道 设备操控消息通道为插件级能力CLI / Headless / SDK 为主成熟度生产可用生态庞大v0.10相对稳定v0.1 开发者预览接口可能破坏兼容⚠️关于数据口径的提醒三个项目的 GitHub Star 数在网上流传的版本差异极大同一个项目从 3.8 万到 25 万 的说法都能搜到这本身说明二手评测不可尽信。所有量化指标请以仓库实时数据为准本文只用架构层面的事实。三个项目各自有一个“签名特性”恰好对应三种不同的下注方向OpenClaw 押触达架构中枢是一个长生命周期的 GatewayWebSocket 守护进程一台主机一个 Gateway独占微信、飞书、Slack、Telegram 等 30 消息通道外加设备操控、cron 定时、heartbeat 心跳。官方定位「The AI that really does things」数据和记忆留在用户自己的机器上。Hermes 押学习设计哲学是闭环学习优先——干完一个复杂任务5 次工具调用后自动判断这套流程值不值得写成技能会话固定间隔收到内部复盘提示自己决定什么该进长期记忆GEPA 学习循环。代码组织也很诚实核心对话循环和工具编排在仓库顶层消息网关反而是次要模块。DSH 押可替换官方定义只有一行公式——Model Harness Agent。框架本身几乎什么都不含运行时只是一个插件加载器基于 Cordis模型、工具、会话、沙箱、循环、调度、UI 全部是插件永远不需要 fork 框架本身。代价也直接开箱什么都不做全靠自己装配。一句话一个要随时随地说得上话一个要越用越懂你一个要什么都能换。02 三个反直觉的发现2.1 它们不是一道选择题的三个选项而是三个设计空间很多选型文章会把三者做成一张打分表谁综合分高选谁。但如果它们本就解决不同问题打分表本身就没有意义。你需要从手机随时指挥一台机器干活 → 这是触达问题你需要同一类活干第二遍时明显更快 → 这是学习问题你需要自己攒一个能换掉每个零件的运行时 → 这是可组合性问题第一个留给你的问题你手里那件想交给 Agent 干的事真正的痛点属于上面哪一类还是说你其实是被开源两个字吸引过来的2.2 同一个词 harness在两个项目里语义正好相反这是整篇文章里我觉得最有讨论价值的一处发现。在 DeepSeek Harness 里harness 是顶层概念——整个框架就是 harness插件是它的零件。在 OpenClaw 里harness 是最底层概念——它内部也有一个AgentHarness接口但官方定义是 low level executor for one prepared agent turn只管这一次 turn 怎么跑官方约束写得很死a harness runs a prepared attempt; it does not pick providers, replace channel delivery, or silently switch models.也就是说当 harness 被选中时core 已经把 provider、model、auth、thinking level、transcript、sandbox、tool policy 全部解析好harness 只能照着准备好的跑不能越权。第二个留给你的问题我们要自建 harness这句话在你们团队里指哪一层是指我们自己掌控模型怎么被调用、上下文怎么组装、工具怎么编排顶层语义还是指我们只是换掉某一次执行回合的底层执行器底层语义这个定义不统一团队内部的技术选型会议大概率会各说各话——就像那些互相打架的 Agent 一样。2.3 OpenClaw 让自建 vs 采购这条线本身模糊了按常理自建和买产品应该是两个选项。但 OpenClaw 卡在中间它开源、可自托管满足自建党对数据主权的要求但它的上手路径被公认为最接近安装一个产品。于是出现一个尴尬的现状你以为自己在自建实际上可能只是在自托管一个产品你以为自己在采购实际上把运维、升级、安全收敛的活全接回来了。第三个留给你的问题能装上就等于能扛住生产吗锁版本、权限收敛、恢复演练、故障排查——这些没写在安装文档里的事你们团队有人负责吗03 产品化那一侧到底给了什么把产品化的四家放在一起看它们收敛到了同一张清单共同项对应能力回答的问题电脑执行环境本机 / Secure VM / Cloud Computer在哪干活记忆长期个人上下文你是谁、在干什么身份凭证、连接器、代表用户的权限以谁的身份干任务长期目标、Automation干多久Meta Muse给每个用户一台独立的 Secure VM有自己的浏览器开始记住用户说过的话并主动带回Manus 2.0把产品重构成 Agent 工作环境——内部 Agent HarnessCascade、Cloud Computer、Automation、Cue 多 Agent 协作OpenAI DotsAlways-on Agents自己的 Cloud Computer连接数千个应用围绕长期目标持续工作并在长期协作中学习什么才算好的结果。注意 Manus 把内部组件命名为Agent Harness这个动作——等于官方承认了一件事决定 Agent 表现的不是模型加 Prompt而是模型、知识、工具、权限、护栏、评测这一整套东西怎么被组织。而这一整套东西恰好就是三个开源自建方案想让你自己攒的东西。第四个留给你的问题你的自建是在解决它做不到的事还是在解决你不放心把这件事交给它这两个理由投入产出比完全不一样。04 真正的分歧不在要不要自建把双方的论据堆到一起会发现吵得最凶的往往是表层问题。往下挖三层真正的分歧在这三件事上。4.1 运行时归谁Runtime OwnershipDSH 的官方叙事很直白Agent 和模型一样都是基础设施——可以自己组装出无数个Codex。它开放多个插件边界模型、工具、会话、沙箱、循环、调度、UI还提供 append-only 的轨迹记录用于重放和分叉。反面论据同样成立运行时的可替换性是用长期处于预览状态换来的。DSH 目前是 v0.1 开发者预览官方明确预期存在破坏兼容的变更。对需要稳定 API 的团队这个成本是实打实的。换句话问你需要的到底是能换零件还是现在就能稳定跑4.2 数据与凭证的边界划在哪四家产品给出的答案完全不同OpenClaw 本机、Muse 官方 Secure VM、Manus 与 Dots 各自的 Cloud Computer。本机路线数据不出门但你得自己承担设备可用性关机了 Agent 就停了云 VM 路线7×24 可用但凭证托管在别人家。换句话问你的凭证邮箱、日历、内部系统托管在哪里是技术偏好问题还是合规硬约束先答这个很多选型争议会自动消失。4.3 账怎么算按会话还是按任务这一条几乎没人展开讲但它会先变成痛点AI 的工作时间单位变了。过去一次交互以分钟计现在 Agent 的任务是把十一的日本行程盯好把这个客户的续约从跟进盯到签约。以会话为单位设计的计费方式、权限体系、审计日志全部要重做。另外同一模型在高峰期与非高峰期的输出成本差距有资料显示可达到数倍有第三方统计给出的峰值倍率约为 4.55×具体口径请以官方定价页为准。这意味着自建的一个隐性收益是成本可控性但代价是你得自己建成本观测——否则可控只存在于架构图上。换句话问你们现在算 Agent 的账单位是 token、是会话、还是任务如果算不清自建未必更省钱只是把账单换了个位置。05 两本账算出来是相反的结论同一个问题个人视角和团队视角的答案正好相反。两边论据都摆在这儿不替你选。个人账本自建的边际成本很低一台常开的机器 一次配置就能跑起来OpenClaw 的 Onboarding 接近产品安装Hermes 的 CLI 与 Setup 路径更短三个项目都是 MIT改坏了重来成本低数据主权在自己手里。个人算账时的盲区时间不算钱。每周花在升级、排障、插件兼容上的小时数通常不会出现在账本里。团队账本自建的隐性成本很高一个能装的系统离能扛生产还有权限收敛、审计留痕、恢复演练、版本锁定四道关复杂系统的生产风险不会因为能安装而消失三个项目的安全边界各不相同且没有简单高下——DSH 防插件组合失控、OpenClaw 防不可信消息跨身份与设备边界、Hermes 防自主执行落到灾难命令。要选型先确认自己的主要攻击面在哪。团队算账时的盲区把工程师能搞定当成组织能搞定。真出事故时要回答的不是技术上能不能修而是谁授权的、日志在哪、怎么跟审计解释。而产品化方案也有它自己的账便利换来的是托管凭证、记忆、上下文都在别人的 VM 里长期任务一开按会话采购的模式立刻不匹配一旦深度使用迁移成本随时间快速上升。第五个留给你的问题你现在站的是个人账本还是团队账本同一套技术两本账的答案相反——这才是这个议题吵不出结论的根本原因。06 一个可以立刻用的检验法不给结论但可以给一个把争论变具体的工具。换平台测试评估任何一项 Agent 能力只问一个问题假设明天更换平台含从自建换到采购、或反过来这项能力是跟着消失还是完好带走跟着消失的是商品——租用就好别自己建。能带走的是资产——必须沉淀在自己名下。这个测试套到自建还是采购上会得到一个有意思的推论你要自建的其实不应该是 harness 本身而是 harness 里那些换了平台就带不走的部分。至于是哪一部分——请各自回答。因为对做软件工程 Agent 的团队、对做长期研究型 Agent 的团队、对只想要一个随时能说话的助理的个人答案大概率是三份不同的清单。第六个留给你的问题如果明天你把现在这套东西全换掉哪些东西是能带走的能带走的那部分就是你这几个月真正攒下来的资产带不走的无论自建还是采购都只是租来的。6.1 实战用 Python 实现「换平台测试」下面这段代码把「换平台测试」落成一个可运行的评估脚本输入当前平台的能力清单输出哪些能力是「可带走」的资产、哪些是「跟着消失」的商品。核心逻辑很简单——对每一项能力判断它是否绑定在某个具体平台上。# -*- coding: utf-8 -*- 换平台测试评估脚本 输入当前平台的能力清单能力名称 是否绑定平台 输出可带走的资产 / 跟着消失的商品 from dataclasses import dataclass dataclass class Capability: 一项 Agent 能力的描述 name: str # 能力名称 platform_locked: bool # 是否绑定在某个具体平台上 def run_platform_switch_test(capabilities): 对每项能力执行「换平台测试」 假设明天更换平台这项能力是跟着消失还是完好带走 assets [] # 可带走的资产 commodities [] # 跟着消失的商品 for cap in capabilities: if cap.platform_locked: # 绑定平台换平台就消失属于商品 commodities.append(cap.name) else: # 不绑定平台换平台也能带走属于资产 assets.append(cap.name) return assets, commodities def main(): 示例某团队当前平台的能力清单 capabilities [ Capability(自定义工具编排逻辑, platform_lockedFalse), Capability(长期记忆与技能沉淀, platform_lockedFalse), Capability(审计日志与权限收敛策略, platform_lockedFalse), Capability(消息通道接入微信/飞书, platform_lockedTrue), Capability(云端执行环境Cloud VM, platform_lockedTrue), Capability(平台内置的自动化调度, platform_lockedTrue), ] assets, commodities run_platform_switch_test(capabilities) print( * 40) print(【可带走的资产】—— 换平台后依然能用) for item in assets: print(f ✔ {item}) print( * 40) print(【跟着消失的商品】—— 换平台后就没了) for item in commodities: print(f ✘ {item}) print( * 40) print(f结论资产 {len(assets)} 项商品 {len(commodities)} 项。) if name main: main()运行结果示例 【可带走的资产】—— 换平台后依然能用 ✔ 自定义工具编排逻辑 ✔ 长期记忆与技能沉淀 ✔ 审计日志与权限收敛策略 【跟着消失的商品】—— 换平台后就没了 ✘ 消息通道接入微信/飞书 ✘ 云端执行环境Cloud VM ✘ 平台内置的自动化调度 结论资产 3 项商品 3 项。把这份清单套回文章里的推论你要自建的其实不应该是 harness 本身而是 harness 里那些「换了平台就带不走」的部分。上面代码里被标记为「可带走」的三项正是值得你投入精力沉淀的资产而「跟着消失」的三项租用就好别自己建。6.2 实战用 DeepSeek Harness 组装一个最小 Agent上一节用 Python 演示了「换平台测试」的评估逻辑这一节回到 DSH 本身——它把模型、工具、会话全部做成插件运行时只是一个插件加载器。下面用 TypeScript 展示如何通过插件机制加载这三个插件并运行一次对话。import { Harness } from deepseek/harness; import { modelPlugin } from deepseek/harness/plugin-model; import { toolPlugin } from deepseek/harness/plugin-tool; import { sessionPlugin } from deepseek/harness/plugin-session; // 1. 模型插件负责与大模型通信决定 Agent 的大脑 // 2. 工具插件注册可调用的外部工具决定 Agent 的手脚 // 3. 会话插件管理上下文与轨迹记录决定 Agent 的记忆 const harness new Harness({ plugins: [modelPlugin, toolPlugin, sessionPlugin], }); const reply await harness.run(帮我查一下明天的天气); console.log(reply);运行结果示例Agent 已加载 3 个插件model、tool、session。 用户帮我查一下明天的天气 工具调用weather.getForecast(city北京) 回复北京明天多云气温 18~26℃建议带一件薄外套。这段代码把文章里的「可组合性」落到最小可运行形态三个插件各司其职模型负责推理、工具负责执行、会话负责记忆而 harness 本身只负责把它们组装起来——这正是 DSH「一切皆插件」的直观体现。07 留给评论区的六个问题这篇文章刻意没有结论因为这个问题在不同场景下真的有两个相反的正确答案。但这六个问题是每个决定自建的人都绕不过去的你的 Agent 跑在谁的机器上凭证存在谁那里换掉现在这套方案你的记忆、技能、轨迹能带走吗你更怕不可控还是更怕不可用——两个恐惧对应完全不同的选择如果 DSH 明天发布 v1.0 并破坏兼容你的迁移成本是多少小时团队里谁负责 Agent 的审计日志和权限收敛——如果没人答得上来这可能不是技术选型问题三个项目里你实际动手跑通过几个——跑通一个的体感胜过读十篇评测评论区欢迎说出你的选择和理由特别是那些跑过之后改了主意的经历。本文对三个开源项目的描述基于公开资料整理各项目仍在快速迭代具体能力以官方仓库为准不构成技术选型建议。参考资料1. DeepSeek Harness 官方发布信息与开发者预览说明2026-08-132. OpenClaw 官方产品描述与插件 SDK 文档AgentHarness 接口、Gateway 架构3. Hermes AgentNous Research2026-02-25 开源仓库与文档4. 三方架构对比的公开技术分析进程 / 扩展 / 状态审计维度5. Meta Muse、Meta Enterprise Platform 发布信息2026.09.08 / 09.286. Manus 2.0、OpenAI Dots 发布信息2026.09.28 / 09.297. 本账号前作《从 Muse 到 DotsAI 助理越来越强个人和企业怎么用价值才最大》