摘要本文解读 CVPR 2025 论文《VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation》。该论文提出VidBot一个只依赖野外单目 RGB 人类视频即可零样本驱动机器人操作的框架通过融合运动恢复结构SfM、度量深度基础模型与粗到细条件扩散把互联网上现成的人类操作视频变成与本体无关的 3D 可供性监督其特别之处在于测试阶段用可微代价函数在线修正轨迹从而把机器人形态与场景几何从训练问题降级为推理期约束。实验表明在 13 个仿真操作任务上零样本取得 88.2% 平均成功率领先次优方法近 20 个百分点并在 Hello Robot Stretch 3 与 Boston Dynamics Spot 两台真机上以 55 次试验获得 80.0% 成功率为机器人模仿学习的数据规模化提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQVidBot 和 VRB 的核心区别是什么VidBot 需要机器人的遥操作数据吗测试时的代价引导会不会很慢为什么必须做度量尺度对齐这个方法能直接迁移到新机器人吗参考链接论文基本信息项目内容标题英文VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation标题中文从野外 2D 人类视频学习可泛化 3D 动作作者Hanzhi Chen, Boyang Sun, Anran Zhang, Marc Pollefeys, Stefan Leutenegger机构Technical University of Munich · ETH Zürich · Microsoft会议CVPR 2025arXivarXiv:2503.07135项目网站hanzhic.github.io/vidbot-project背景与动机机器人模仿学习长期依赖人类专家的遥操作示范Open X-Embodiment 与 DROID 这类大规模数据集证明了规模化的价值但采集成本随本体系、任务与环境三者的组合爆炸而失控。论文因此提出一个更激进的问题能否完全不要机器人示范只从互联网上已经存在的人类操作视频中学习操作技能既有的视频学习路线各有代价。以 R3M、VIP、Masked Visual Pretraining 为代表的视觉表征预训练需要在新环境、新本体上重新采集遥操作数据做微调VRB 首次用大规模人类视频提取与本体无关的交互轨迹但把动作简化成了图像平面内的 2D 方向向量缺乏空间意识遇到开柜门这类曲线交互就会打滑GFlow 与 Track2Act 引入流表示获得空间感知代价是测试时必须提供目标图像或初始接触区域训练时还依赖真值深度与物体位姿。论文把这件事拆成两个可验证的子问题第一如何从纯 RGB 的野外视频中提取3D 可执行知识第二如何让这些知识以零样本方式迁移到新环境与新本体。作者给出的答案是用几何方法把监督信号制造出来再用测试时约束补上本体差异。这条路线也顺应了可供性学习的历史演进——从 2021 年 Where2Act 在仿真虚拟资产上学方向向量到 2023 年 VRB 转向人类视频再到 2025 年 VidBot 把监督拉进度量 3D 空间。图 7VidBot 研究主线问题遥操作成本爆炸→ 动机改用野外人类视频→ 设计SfM 与度量深度制造 3D 监督→ 方法粗到细条件扩散 测试时代价引导→ 结论零样本跨本体操作基准/方法设计VidBot 的形式化目标是学习一个因子化的可供性模型 $\mathbf{a} \pi(\tilde{\mathbf{I}}, \tilde{\mathbf{D}}, l)$输入 RGB-D 帧与语言指令 $l$输出接触点 $\mathbf{c}$ 与 3D 交互轨迹 $\bm{\tau}$。整个系统分成数据与学习两条主线数据侧先由 SfM 估计相机内参与尺度未知的位姿由度量深度基础模型预测稠密深度再联合优化全局尺度与逐帧位姿尺度把重建拉进度量空间从而抹掉动态手物运动带来的误差。学习侧粗阶段从像素空间预测目标点 $\mathbf{g}$ 与接触点 $\mathbf{c}$细阶段以它们为条件用 1D U-Net 做条件扩散生成细粒度轨迹。输出侧轨迹的起点与终点被映射成可微代价可以直接接入下游全身规划。这套设计的价值在于监督来源与方法解耦数据提取管线依赖的是通用的 SfM 与深度基础模型而不是某一种机器人或某一种任务。图 1方法总览从野外 RGB 人类视频提取可供性学习到的模型可跨机器人本体部署于日常操作任务论文 Fig. 1分类全景从数据来源看机器人可供性学习可以分成三条互不相同的技术路线VidBot 属于第三条并且把表示层次推到了 3D图 8可供性学习的数据来源全景仿真虚拟资产Where2Act / GAPartNet、遥操作示范Octo与人类视频VRB / GFlow / VidBot本文属于人类视频路线中的度量 3D 轨迹分支方法细节第一步是数据准备。SfM 给出相机内参 $\mathbf{K}$、尺度未知的逐帧位姿与稀疏地标深度基础模型预测稠密深度手物检测与分割网络给出静态区域掩码把动态的手与物体从几何优化中剔除。第二步是一致位姿优化。论文先用稀疏地标的重投影残差最小化求全局尺度 $s_g$把它固定为参考帧的尺度再联合优化其余帧的位姿与尺度让跨视图的反投影点对齐。这一步是整套监督信号可靠性的关键——没有它从视频里恢复出的手部轨迹在时间上不连续、在尺度上不统一无法作为训练标签。第三步是可供性抽取。把逐帧手中心点变换到首帧得到轨迹对首帧的手点降采样得到接触点对末帧降采样得到目标点分别用于监督粗阶段与细阶段。训练之外论文最巧的设计是把“多次采样不同目标点”改写成单一去噪过程中的可微代价。多目标代价 $\mathcal{J}_{goal}$ 度量轨迹终点与候选目标集的最近距离碰撞代价查询预计算的 TSDF 做碰撞规避法向代价约束接触法向三者按权重 $\lambda_g$、$\lambda_c$、$\lambda_n$ 加权求和。每一步去噪再用梯度对未加噪预测做重建引导修正既避免了多次前向传播又把最终代价当作挑选最优轨迹的启发式。图 2可供性模型总览粗阶段解析接触与目标配置细阶段以其为条件、并由代价函数引导生成细粒度交互轨迹颜色越深表示代价越低论文 Fig. 2图 3从原始人类视频中提取的 3D 手部轨迹示例论文 Fig. 3实验设计与结果仿真部分使用 IsaacGym环境基于 AG2Manip 构建从 FrankaKitchen、PartManip、ManiSkill 三个基准中选出 13 个日常家务任务覆盖开门、关柜、推拉抽屉、微波炉、洗碗机、抓水壶、抓取杂物、掀盖等动作原语。评测协议为每个任务 3 个视角、每视角 5 条轨迹共 15 次试验指标是成功率真机则在 3 个家居环境中用 2 台机器人完成 55 次试验。方法平均成功率 (%)训练数据来源相对 VidBotGAPartNet51.1仿真虚拟资产−37.1Where2Act58.5仿真虚拟资产−29.7VRB†59.0人类视频2D 轨迹−29.2GFlow61.0人类视频含真值深度−27.2Octo*69.2遥操作 本文数据微调−19.0VidBot本文88.2人类视频仅 RGB—13 个任务的完整消融实验进一步说明每个设计点的必要性变体平均成功率 (%)相对完整模型VidBot 完整模型85.6—去掉粗阶段目标预测 [V1]57.8−27.8去掉多目标引导 [V2]73.3−12.3去掉接触法向引导 [V3]76.7−8.9去掉碰撞规避引导 [V4]77.8−7.8去掉代价启发式 [V5]74.5−11.1值得注意的是去掉碰撞规避引导在抓取可携带物体的 AT06 任务上单任务下降 26.7 个百分点说明几何约束对涉及空间通道的任务尤其关键。两台真机上的表现同样具有说服力Stretch 3 与 Spot 均以机载 RGB-D 感知加语言指令工作在三个环境中完成推抽屉、开柜门、取纸巾等任务总体成功率 80.0%。图 4与 VRB 的定性对比同样的 RGB 视频监督VidBot 直接给出 3D 接触点与轨迹并展示代价最低的 5 个候选论文 Fig. 4图 5下游机器人学习应用(a) 视觉目标到达任务平均成功率(b) 探索任务的偶然成功率论文 Fig. 5图 6真机实验结果与推断出的可供性上排Stretch 3 与 Spot 在三个环境中执行家务操作论文 Fig. 6结果对比总结把主表、消融与真机结果串起来看VidBot 的收益来源可以量化成一张对照图图 9结果对比总结与同源监督的 VRB 相差 29.2 个百分点与 Octo 相差 −19.0 个百分点真机 55 次试验 80.0%关键发现同源对照最有说服力VRB 与 VidBot 共享同一批人类视频监督成功率从 59.0% 提升到 88.2%说明瓶颈不在数据量而在表示层次——2D 方向向量换成度量 3D 轨迹。粗阶段是最大单点依赖去掉粗阶段目标预测后成功率从 85.6% 掉到 57.8%下降 27.8 个百分点证明直接从高维观测生成细粒度动作非常困难。引导项与生成质量同等重要多目标引导贡献 12.3 个百分点碰撞规避与接触法向分别贡献 7.8 与 8.9 个百分点代价启发式再加 11.1 个百分点。模式上同时命中三条创新模式其一制造监督信号——用 SfM 与度量深度把纯 RGB 视频变成 3D 标签其二统一异构输入到同一空间——机器人与人类手共享同一个可供性空间本体只在推理期以代价形式出现其三重新表述为可解对象——把多次采样目标点改写成单次去噪中的可微代价。下游可复用在视觉目标到达与探索两类任务上VidBot 收敛更快、最终成功率更高说明可供性模型可以当作通用先验复用到策略搜索。写作层面的观察论文开篇以一个宏大问题开场随即拆成两个可验证的子问题最后用 13 个任务与 55 次真机试验兑现承诺证据框架是最强杠杆数字前置surpassing the runner-up method by nearly 20%但新颖性表述中仍保留 promising 一类弱化词。校对时还发现正文两处漏词与一处主谓不一致阅读原文时需留意。局限性监督质量受上游制约3D 标签的精度取决于深度基础模型与 SfM 管线的精度论文只用最终优化损失过滤低质量标签没有显式建模不确定性。采集假设较强需要已有的 SfM 结果如 EpicFields、移动单目相机以及可用的手物检测与分割模型严重动态遮挡的长视频仍会破坏重建。引导项依赖外部几何碰撞规避需要预计算 TSDF并假设物体可携带三个权重 $\lambda_g$、$\lambda_c$、$\lambda_n$ 需人工设定未见自适应策略。评测范围有限13 个任务集中在单物体关节操作未覆盖长程、多物体组合与双臂协同等更贴近真实家务的场景。常见问题FAQVidBot 和 VRB 的核心区别是什么两者都用人类视频训练但表示层次不同。VRB 把交互抽象成图像平面内的 2D 方向向量VidBot 输出度量 3D 空间中的接触点与轨迹在同一批视频监督下成功率从 59.0% 提升到 88.2%。VidBot 需要机器人的遥操作数据吗不需要。VidBot 的监督完全来自野外单目 RGB 人类视频机器人数据只作为基线Octo 微调出现论文在一台 Hello Robot Stretch 3 与一台 Boston Dynamics Spot 上做了零样本验证55 次试验成功率 80.0%。测试时的代价引导会不会很慢不会。论文把多次采样不同目标点重新表述为单一去噪过程中的可微代价 $\mathcal{J}_{goal}$无需反复调用模型碰撞规避与接触法向复用预计算的 TSDF因此整个引导过程是单次采样内完成的。为什么必须做度量尺度对齐轨迹尺度不统一时从视频恢复的手部运动无法对应真实物理距离作为标签会引入系统性偏差。论文先用稀疏地标重投影最小化求全局尺度再联合优化位姿与逐帧尺度使深度在多视图间自洽。这个方法能直接迁移到新机器人吗可以前提是新本体能提供 RGB-D 观测与深度。可供性表示与本体无关更换机器人只需改变测试时代价中的手部或夹爪模型论文正是在两个异构平台上验证了这一点。参考链接论文 arXiv 页面arXiv:2503.07135项目网站与视频演示hanzhic.github.io/vidbot-projectCVPR 2025 开放获取版本VidBot (CVPR 2025)最相关基线 VRBAffordances from Human Videos as a Versatile Representation for Robotics流表示基线 GFlowGeneral Flow as Foundation Affordance for Scalable Robot Learning策略与扩散基线Octo: An Open-Source Generalist Robot Policy、Diffusion Policy仿真资产基线GAPartNet、Where2Act给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件