MetaClaw为何登顶HuggingFace每日论文榜OPD在线蒸馏与MAML支持/查询集分离研究亮点深潜【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClawMetaClaw 是一款开源的元学习 AI 智能体框架口号是和你的智能体聊聊它就能学习并进化Just talk to your agent — it learns and EVOLVES。它把真实对话变成学习信号让智能体在野外部署中持续变强全程无需 GPU 集群只需接入 LLM API。其技术报告发布当天登顶 HuggingFace 每日论文榜本文用通俗的方式带你深潜两大核心研究亮点OPD 在线蒸馏与MAML 支持集/查询集分离。 先看全局MetaClaw 凭什么越聊越强MetaClaw 的核心思路是给模型装上一个透明代理Proxy你的个人智能体OpenClaw、CoPaw、IronClaw 等 8 款客户端照常对话代理在每一轮注入相关技能、压缩上下文会话结束后自动总结沉淀出新技能开启强化学习后由元学习调度器把权重更新推迟到空闲时段训练全程不打断你聊天。它提供三种运行模式覆盖从零门槛到全量自进化模式命令能力skills_onlymetaclaw start --mode skills_only技能注入 自动总结无需 GPU/训练后端rlmetaclaw start --mode rl技能 GRPO 强化学习可选 OPD 教师蒸馏auto默认metaclaw start技能 RL 空闲窗口智能调度 亮点一OPD 在线蒸馏——让学生在真实对话中学老师OPDOn-Policy Distillation在线策略蒸馏是 RL 模式的一个可选增强解决一个经典矛盾大模型强但调用贵小模型快但能力弱。传统离线蒸馏用老师生成好的数据喂学生存在分布不匹配问题。MetaClaw 的 OPD 换了一个思路学生模型照常生成回复on-policy数据来自自己当前的策略教师模型如更大的 32B 模型对这些同一条回复逐 token 给出对数概率用KL 散度惩罚把学生策略拉向教师的分布。这样学生学到的不是背老师的台词而是在自己的输出分布上变得更像老师蒸馏效果更稳定。整个流程与 PRM 裁判打分并行异步执行对线上服务零干扰。开启方式只需几条配置详见 README.md 的 OPD 小节metaclaw config opd.enabled true metaclaw config opd.teacher_url http://localhost:8082/v1 metaclaw config opd.teacher_model Qwen/Qwen3-32B metaclaw config opd.kl_penalty_coef 1.0想完整跑一遍可以直接参考端到端示例 examples/run_conversation_opd.py 和 scripts/run_openclaw_tinker_opd.sh蒸馏损失与 KL 系数的实现位于 metaclaw/trainer.py配置项定义在 metaclaw/config.py。 亮点二MAML 支持集/查询集分离——防止旧经验污染训练这是 MetaClaw 技术报告中最元学习的一笔对应 v0.3 版本引入的**支持/查询集分离support/query set separation**机制。问题场景智能体的技能库在持续进化。假设某个失败案例触发了技能进化生成了一批新技能——那么进化之前积累的对话样本其奖励信号已经是旧技能下的评价直接拿去更新权重等于用过期的奖励信号做梯度更新会污染训练。MetaClaw 的解法借鉴了 MAML 中支持集与查询集分离的思想每条对话样本都打上 **skill_generation技能版本号标签一旦技能进化使版本号递增训练器立即清空 RL 样本缓冲区和输出队列丢弃所有进化前的样本下一个 RL 训练批次只使用进化后采集的新数据。一句话引发进化的样本是支持集只用于学技能权重更新只吃查询集新技能下的新数据。日志中会明确打印丢弃了多少过期样本整个过程完全透明。相关实现可阅读metaclaw/trainer.py缓冲区清空逻辑、metaclaw/rollout.py队列清理与 metaclaw/data_formatter.py样本标签定义。 配套机制元学习调度器只在你不在时学习RL 权重热更新需要几分钟若恰好在你打字时触发就太扫兴了。因此auto模式下慢更新RL 梯度更新只在三种空闲窗口之一打开时执行睡眠时段可配置的起止时间如 23:00–07:00⌨️键盘闲置离开键盘超过 N 分钟即触发日历事件检测到 Google Calendar 会议会中摸鱼式训练。若用户在更新中途回来部分批次会自动保存并在下个窗口续训。调度器核心代码见 metaclaw/scheduler.py、metaclaw/idle_detector.py 与 metaclaw/calendar_client.py。 快速上手两条命令跑起来pip install -e .[rl,evolve,scheduler] # 完整功能安装 metaclaw setup # 交互式配置向导 metaclaw start # 默认 auto 模式启动向导会引导你选择智能体类型OpenClaw/CoPaw/IronClaw/NanoClaw 等、认证方式和 LLM 提供商随后metaclaw start自动完成代理部署与网关接线。v0.4.0 还新增了跨会话长期记忆层情景/语义/偏好/项目状态详见 metaclaw/memory/ 目录与 README 的 Memory 章节。 附想验证它的学习能力试试 MetaClaw-Bench项目内置了一个评估智能体多日交互历史中学习适应能力的基准数据集含 30 天完整版与 12 天精简版覆盖校验、推理、打分、报告全流程文档见 benchmark/README.md数据位于 benchmark/data/metaclaw-bench/ 与 benchmark/data/metaclaw-bench-small/。 小结MetaClaw 登顶榜单并非偶然OPD 在线蒸馏让小模型在真实流量中贴身学习大模型MAML 支持/查询集分离保证了技能进化与权重更新互不污染再配合空闲窗口调度实现无感自进化。三招组合拳让AI 智能体越用越聪明第一次以工程可复现的形态落地——而这一切你不需要一块 GPU。【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考