摘要本文解读 CoRL 2026 论文《Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams》。该论文提出ARMSAlways-onRobot inMulti-modalStreams通过融合流式视觉触发门、具身状态头与自身动作压缩记忆三个轻量模块把单个预训练的 $\pi_{0.5}$ 视觉-语言-动作主干改造成能在永不重置的流上「边看、边回忆、边动作」的常开策略其特别之处在于不新增网络、不加规划器而是把观看、回忆与避碰全部归约为往主干动作前的上下文里放什么三个模块异步更新、不阻塞动作双臂因此可以并发工作。实验表明组合任务动作成功率从最强基线的 28% 提升到 45%17 个百分点跨中断回忆率从 15 提升到 72且消融显示记忆模块、具身状态头与异步并发三者缺一不可为长时程、无清晰起止的机器人部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息一、常开机器人为什么难决策信息与动作时刻在时间上被拆开二、研究主线从问题到结论三、基准/方法设计一个主干三个上下文提供者四、分类全景三路上下文与各自的监督来源五、方法细节协调降维成一句话记忆压缩而非流水账六、实验设计与结果七、结果对比总结八、关键发现九、局限性十、常见问题FAQARMS 和「给 VLA 加记忆」的区别在哪里为什么不用更大的模型而是三个小模块「异步并发」到底带来多少收益这类系统的数据从哪来Probe 与 Online 两个协议为什么要一起用论文在表述上有哪些值得注意的问题十一、参考链接论文基本信息项目内容标题英文Watch, Recall, Act: Always-On Robots in Concurrent Embodied Streams标题中文常开机器人的流式上下文边看、边回忆、边动作作者Ding Yi, Peiwen Sun, Chenchu Rong, Jianan Wang, Xili Dai, Xiangyu Yue, Xi Lin机构Shanghai Jiao Tong University · The Chinese University of Hong Kong · Nanjing University · Astribot · Juxi Tech会议CoRL 2026arXivhttps://arxiv.org/abs/2609.28429项目网站暂无论文承诺公开 ARMS Dataset 与数据构建代码arXiv v1 未附链接一、常开机器人为什么难决策信息与动作时刻在时间上被拆开多模态模型正在从离线框架走向流式理解模型同时具备主动性监测流、在条件成立时才动作与回溯性回忆流中很久以前发生的事。对机器人而言流式不是可选项——机器人活在同一条永不重置的时间线里相机不会关闭指令会到来也会失效它必须同时感知与行动。论文把这种部署条件概括为三个必须同时成立的需求Watch观看为远景触发持续扫描第一人称流例如「凡是被放到你面前的东西都收起来」——这条规则可能在设定很久之后才触发Recall回忆自指指令「把第二个你收好的放进箱子」只能由机器人自身动作的记录来回答当前帧里根本没有这个信息Act动作输出必须是真机上的物理动作而且要在双臂并发下保持安全——两条手臂共享并不断扰乱同一个场景执行动作本身就会改变它接下来要理解的画面。论文进一步指出把这些能力拆开看每个单项能力都已被现有工作覆盖但组合才是难点。下表是论文给出的能力矩阵Always-on、Proactive、Retrospective、Interruptible、Concurrent 五个轴系统常开主动触发回忆自身可中断并发执行SwitchVLA否否否是否MemoryVLA否否是否否VITA-E是否否是否Habilis-$\beta$是否否否否RoboStream是否是否否ARMS本文是是是是是从历史脉络看这条线已经走过四级台阶流式与主动视频理解VideoLLM-online 把语言模型拉进在线视频流Dispider 解耦感知/决策/反应并给出异步骨架后被本文直接继承→主动性与及时性基准ProactiveVideoQA 提出 timeliness 指标、RIVER 统一直播/回顾/主动框架但它们只「回答」不产生物理动作→机器人侧的记忆与常开运行MemoryVLA、RoboStream 走记忆线SwitchVLA、VITA-E、Habilis-$\beta$ 走常开与并发线→ARMS 把观看、回忆、动作与双臂并发合到真机上。从技术定位的角度看这篇论文的核心动作是把「常开机器人怎么做」从一个机制问题重新表述为一个上下文装配问题既然每条能力最终都表现为「主干在动作前读到了什么」那么工程上就不需要为每种需求各造一个模块只需要为同一个主干准备好三路上下文。换句话说上下文正在从「世界状态」变成「运行时状态」。二、研究主线从问题到结论图 4Mermaid 流程图ARMS 研究主线。问题永不重置的流、指令会失效→ 动机决策信息与动作时刻在时间上分离→ 数据约 200 条 staged stream→ 方法一个 $\pi_{0.5}$ 主干 三路异步上下文→ 实验四族闭环评测→ 结论45% vs 28%、三模块缺一不可。三、基准/方法设计一个主干三个上下文提供者ARMS 的骨架是一个预训练的 $\pi_{0.5}$ 视觉-语言-动作模型视觉语言 Transformer 加动作专家原架构完整保留包括它的视觉编码器。围绕它论文只加三个轻量模块每个模块把一路信号变成主干能读的 token 或一句话视觉触发门复用 $\pi_{0.5}$ 自己的视觉头作为高频、非阻塞的二值闸门判断守卫关心的目标是否出现、条件是否成立答案为「否」时它全速扫描而不唤醒动作专家因此常开流不会把算力烧光而一旦转「是」编码后的视觉 token 就进入主干上下文。具身状态头读当前观测与本体感受向上下文追加一句话同时携带每条手臂当前的动作原语抓取、释放、接近、空闲与一次碰撞检查按当前与意图运动判断双臂是否在冲突路径上。自身动作记忆维护一份动作史 $\mathcal{H}$每条完成的动作被压成紧凑条目做了什么、哪只手臂、哪个物体、何时并做归并使记忆在无界流上保持有界回忆指令到达时检索并回写成一句话供主干使用。三路信号共享同一个上下文接口第 $t$ 步主干读取的上下文可以写成 $\mathcal{C}t [\,\text{vis}_t;\ \text{mem}(\mathcal{H}_t);\ \ell;\ \text{state}_t\,]$动作由 $a_t \sim \pi{0.5}(\mathcal{C}_t)$ 自回归产生。模块在更重的动作前向之外异步更新主干按需读取这正是任务级并发成立的原因同时由于每个模块的输出都是显式的它们也可以在不执行动作的情况下被读取于是同一套系统还能充当「只识别」的探针。图 1常开流的任务时间轴。不同任务可以重叠前景任务、主动任务与回溯查询处理它们要求模型在对的时刻、对的具身上完成观看、回忆与动作。四、分类全景三路上下文与各自的监督来源图 5Mermaid 分类图三路上下文提供者与监督来源。三路信号共享同一个 $\pi_{0.5}$ 主干上下文接口视觉触发门、具身状态头、自身动作记忆的标签分别来自构造脚本的触发标签、动作原语与碰撞标签、动作史与指令-目标对。三个模块的监督都来自数据构造脚本本身而不是策略 rollout因此不存在循环依赖——这一点在下一节的方法细节里展开。五、方法细节协调降维成一句话记忆压缩而非流水账第一把协调降维成一句话。具身状态头不做几何规划而是输出类似「左臂正在把杯子收进箱子右臂去够盘子的路径是通的」这样的句子让主干自己决定是派一条并发动作给空闲手臂还是把它串行化。论文强调这不是能力缺失而是刻意的设计避碰与手臂协调变成主干能读的上下文而不是一个覆盖主干的模块。第二压缩而不是流水账。记忆模块沿用感知-认知双层记忆的思路但目标是有界每条完成的动作被摘要成条目并归并因此在十分钟以上的流上 $\mathcal{H}$ 保持有界。这也解释了同类物体如何区分——两根香蕉无法靠外观分开只能靠「何时与如何被操作」的记录检索时按存储的对象 ID 在「最后已知身份」假设下匹配。第三监督来自数据构造而不是策略 rollout。本文的数据是构造出来的有人按提示摆放物体第三项需求强制推迟脚本在摆场时就已经写下了每个模块所需的标签触发、动作原语、碰撞、指令与目标对。因此三个模块的训练不依赖它所增强策略的 rollout避免了循环依赖。图 2ARMS 架构。高频感知路径运行门控视觉触发只有正触发才唤醒低频的推理与动作路径——单个 $\pi_{0.5}$ 主干读取注入的上下文视觉 token、压缩记忆、语言指令、具身状态头的原语与流自回归输出双臂动作 token。六、实验设计与结果数据。ARMS Dataset 由作者自采平台是 Cobot Magic 双臂机器人低成本的 Mobile-ALOHA 式遥操作装置约200 条永不重置的 staged stream每条数分钟有人按提示摆物、双臂同时在干活、第三项需求强制推迟与约1,200 条短技能示范覆盖约6 个双臂技能与约15 类物体其中至少2 组同类干扰物。每条被计分的动作都是真实遥操作示范不使用合成数据LIBERO 只作为可选的规模放大。协议。评测分四族A 前景任务与守卫并发触发、B 用语言回忆自身过去动作、C 重定位被自身移位的目标、D 双臂皆忙时新守卫到达的仲裁。评测是闭环的——把录制场景重组成常开流并在真机上执行所以每个物理指标都反映已执行的动作。除六个分项指标跨中断回忆、前景延续率、自历史一致性、双臂非干扰、过载排序、PAUC 式及时性外头条指标是组合任务动作成功率EAS一次不中断的运行里前景完成、每个触发的守卫都由空闲手臂无碰撞服务、回忆返回正确的历史物体、过载排序符合优先级标签才算成功。方法跨中断回忆前景延续自历史一致EASFixed-rate VLA滑窗1022516MemoryVLA44284024SwitchVLA15581828Recognition$\rightarrow$Controller40214519ARMS本文72768245Oracle / Human上界93929685表中的读法很直接每个基线只占自己那一角。MemoryVLA 能回忆44但前景延续只有 28SwitchVLA 能延续前景58却取不回自身历史动作15而高回忆且高延续的区域除人类/oracle 上界之外只有 ARMS 落在里面72/76。端到端 EAS45% vs 28%提升17 个百分点但仍比 85% 左右的人类天花板低约40 个百分点——论文因此强调这个设定远未被解决。消融。论文逐个移除模块变体跨中断回忆前景延续自历史一致EASARMS本文72768245去掉记忆模块31742732去掉自身因果标签50755538记忆去掉时序序次48755836去掉具身状态头58588134硬中断无异步并发68418030去掉记忆模块回忆率从 72 掉到 31低于单类随机水平只去掉记忆中的时序序次类别还认得但对「第二个」的序数回忆被毁掉EAS 降到 36去掉具身状态头前景延续从 76 掉到 58、双臂非干扰从 78 掉到 68把异步并发换成硬中断伤得最重前景延续 76→41、非干扰 78→38。其中「去掉自身因果标签」这一组最能说明设计要义保持同样的记忆容量只把「哪只手臂、何时」这类来源信息抹掉、退化成世界状态记忆回忆率就从 72 掉到 50、自历史一致性从 82 掉到 55——收益来自来源标注而不是更大的记忆。真机与长流。真机上做了三轮随机化任务布置、每轮 20 次试验$N60$/方法/段评测段指标ARMS最强基线观看 并发清杯时收水果成功率 / 前景恢复65 / 7020 / 28回忆「第二个你收好的」成功率6013自扰动双臂遮挡重定位成功率6218长流$\geq$10 min 不重置保持率6730差距最大的两段恰好是「自身动作改变了未来状态」的地方回忆段 60 vs 13自扰动段 62 vs 18。而在十分钟以上永不重置的流里记忆保持有界策略保持 67% 而最强基线 30%单张 80 GB 加速卡上双臂同时执行时中位触发到决策时延低于 200 ms。图 3真机定性结果单条永不重置的并发 episode。前景行是把杯子清进箱子下方 initial/cue/act/outcome 四列显示两个主动守卫先后触发香蕉、胡萝卜空闲手臂各自收好随后的自指指令「把第二个你收好的放进箱子」在双臂遮挡下解析为胡萝卜并装箱。七、结果对比总结图 6Mermaid 流程图结果对比总结。EAS 45% vs 28%17pp分叉为三条证据回忆 72 vs 15来源标注承重、前景延续 76 vs 28异步并发承重、长流保持 67% vs 30%记忆有界三条证据共同指向同一处残差——真机执行距人类上界 85% 约 40 个百分点。八、关键发现组合不可分解五个能力轴常开、主动、回忆、可中断、并发里已有系统各占一角论文的能力矩阵显示只有 ARMS 五个轴全中。EAS 45% vs 28%17pp而 Oracle/Human 上界是 85%——差距被论文明确留在台面上。跨中断回忆 72 vs 15MemoryVLA 能回忆但前景崩塌28SwitchVLA 能延续前景却取不回自身历史15两者不可兼得是基线共同的天花板。三个模块各自承重去掉记忆、具身状态头、异步并发EAS 分别掉到 32、34、30基准 45。来源标注比容量更值钱同容量下去掉「哪只手臂、何时」回忆 72→50、自历史一致性 82→55。异步本身就是能力把异步并发换成硬中断前景延续 76→41、非干扰 78→38说明「把动作派给空闲手臂」优于打断前景。瓶颈在执行而非感知Probe 协议下识别率保持 80% 以上而动作成功率在并发与自扰动下衰减——这是一个动作问题不是视频问答。长流不退化$\geq$10 min 不重置流上记忆保持有界保持率 67% vs 基线 30%。九、局限性真机证据规模小、平台单一全部真机结果来自同一台 Cobot Magicstaged stream 只有约 200 条完整过载机制主要在 D 族被触发证据最薄。守卫由人预先写定站立规则是人写下的模型不会自己发现新的值得守候的条件。优先级是固定档位默认过载策略使用数据集定义的优先级层不随场景学习或协商。真机演示的回忆可能借助外观该演示用的是两个不同物体只能靠来源与次序区分的同类物体情形与完整过载只在数据集的 B、D 族上量化更大规模的真机评测留作未来工作。作者给出的下一步是更大规模的真实数据、可学习的守卫与优先级以及更丰富的过载策略论文同时承诺公开 ARMS Dataset 与数据构建代码。十、常见问题FAQARMS 和「给 VLA 加记忆」的区别在哪里多数记忆工作记的是世界状态场景里有什么、发生过什么转移而 ARMS 记的是自身因果哪只手臂、在何时、做了哪个受守卫驱动的动作。论文用同容量对照证明这一点是承重的——抹掉来源标签回忆率从 72 掉到 50、自历史一致性从 82 掉到 55。为什么不用更大的模型而是三个小模块因为论文把问题定位为上下文装配而不是容量或延迟主干$\pi_{0.5}$完整复用只有三路上下文是新增的且在四个基线共享同一初始化与训练预算的前提下取得 17pp。单卡 80 GB、双臂并发下中位时延低于 200 ms 也是这个设计的结果。「异步并发」到底带来多少收益硬中断对照给出了答案把异步并发换成硬中断前景延续从 76 掉到 41、双臂非干扰从 78 掉到 38EAS 从 45 掉到 30——比去掉任一模块都更伤。这类系统的数据从哪来全部来自自采的真实遥操作约 200 条 staged stream 加约 1,200 条技能示范。关键在于数据是构造的构造脚本本身就是标注来源因此模块监督不依赖策略 rollout也不存在循环依赖。Probe 与 Online 两个协议为什么要一起用Online 只评端到端动作Probe 只评「是否知道该在何时对什么动作」。两者对照才能把失败归因到感知还是执行本文的数据显示识别率保持 80% 以上而动作掉档所以残差在执行侧。论文在表述上有哪些值得注意的问题作者块把单位写成 Jiaotong规范为 Jiao Tong参考文献中有一处作者名乱码「识别率超过 80%」这一关键数字只出现在散文里没有对应表格数据集与代码承诺公开但正文没有链接也没有致谢章节。这些都是引用时需要留意的细节。十一、参考链接论文 arXiv 摘要页https://arxiv.org/abs/2609.28429一作主页Ding YiSJTUhttps://onedonedone.com/通讯作者主页Xi LinSJTU 计算机学院https://www.cs.sjtu.edu.cn/jiaoshiml/linxi.html资深作者主页Xiangyu YueCUHK MMLabhttps://xyue.io/DispiderCVPR 2025本文继承的异步非阻塞骨架https://arxiv.org/abs/2501.03218MemoryVLAICLR 2026记忆基线https://arxiv.org/abs/2508.19236RoboMMEICML 2026机器人记忆评测基准https://arxiv.org/abs/2603.04639ControlVLACoRL 2025作者 Jianan Wang 的通讯工作https://arxiv.org/abs/2506.16211给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件