当前位置: 首页 > news >正文

WALA:从带动作标签的演示和无动作视频中学习可执行

26年7月来自中科院自动化所、无界动力、中科院大学、新加坡国立和西交利物浦大学的论文“WALA:Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos”。

具有泛化能力的机器人策略通常依赖于带有动作标注的机器人演示数据,但此类数据收集成本高昂且难以规模化。相比之下,大规模且易于获取的人类视频记录了丰富的物理交互过程,却缺乏可直接用于机器人控制的动作标注。为此,提出 WALA 框架,该框架能够联合利用带有动作标注的演示数据和无动作标注的视频,学习可执行的潜动作(latent actions)。WALA 首先在无动作标注的视频上预训练一个语义-几何潜动作模型,使其能够通过当前观测与多个稀疏采样的未来观测之间的场景演变,学习与动作相关的表征。具体而言,WALA 构建语义和几何层面的未来变化量(deltas),编码器从中提取潜动作目标,而解码器则在 DINOv3 特征空间和稠密深度空间中预测这些未来变化量。

这种方法避免原始像素重建,在保留任务相关的语义和几何结构的同时,降低外观细节的干扰。在策略训练阶段,预训练的编码器保持冻结以提供稳定的潜动作目标,解码器则作为可训练的潜世界模型发挥作用。由视觉-语言主干网络生成的潜动作,受到机器人动作预测、潜动作目标匹配以及未来动力学预测的联合监督。带有动作标注的演示数据同时提供可执行控制信号和动力学监督,而无动作标注的视频无需机器人动作标签,仍可通过潜动作和未来动力学监督参与训练。通过这种方式,WALA 将视频中的物理场景演变与可执行的机器人控制联系起来。实验表明,WALA 在 RoboTwin 上表现优异,并在 RoboCasa 上达到 75.2% 的平均成功率,刷新该领域的最佳性能记录。针对真实机器人的进一步实验也验证其在多种操作任务中的泛化能力。


1 概述

WALA 从带有动作标签的演示数据和不含动作标签的视频中学习可执行的潜动作。该框架包含两个阶段。在第一阶段,预训练一个语义-几何潜动作模型(如图 1 所示)。该模型利用当前帧以及基于多个稀疏采样帧计算出的未来变化量(deltas),学习能够解释未来语义和几何变化的潜动作。

在第二阶段,将预训练模型整合到策略学习中(如图 2 所示)。此时,预训练编码器被冻结以提供稳定的潜动作目标,而解码器则作为可训练的潜世界模型使用。

2 语义几何潜动作模型

该潜动作模型包含一个编码器和一个解码器。编码器接收当前观测值以及观测的未来变化量,并从场景演化中推断潜动作tokens。RGB分支捕获DINOv3特征空间中的语义变化,而深度分支捕获稠密深度空间中的几何变化。这两个分支融合以生成统一的潜动作表示。

其使用增量而非绝对的未来状态,促使 z_t 表示基于当前状态的相对场景演变。输出 z_t 是一组潜动作tokens。相同的未来增量被用作预测目标。解码器根据当前状态和潜动作预测这些语义和几何变化。

RGB 解码器预测 DINOv3 特征空间的变化。深度解码器预测密集的深度变化。未来状态是通过将预测的变化添加到当前状态来获得的。

RGB 预测损失使用 l1 项和余弦项。余弦项是基于预测的 DINOv3 特征增量与目标 DINOv3 特征增量计算得出的。深度预测损失包含密集深度回归项和深度梯度一致性项,其中的梯度项用于匹配预测深度变化与真实深度变化之间的水平及垂直深度梯度。

在上述损失计算中,Delta X 和 Delta D 表示所有采样的未来增量,且损失值是在未来时间步和空间位置上取平均计算得出的。预训练目标函数为 L_{LAM} = L_{rgb} + lambda_{dep} L_{dep}。该目标函数促使潜动作编码与任务相关的语义及几何变化,从而避免将模型容量消耗在像素级的图像重建上。

3. 基于潜世界监督的策略学习

预训练后,WALA 使用潜动作模型来监督策略学习。预训练的编码器被冻结。给定当前观测值和观测到的未来变化量,它生成潜动作目标。其中冻结编码器可以确保策略训练期间潜目标空间的稳定性。

视觉语言骨干网络(在实现中采用 Qwen3-VL-4B [22] 实例化)接收多视角 RGB 观测值、语言指令、机器人状态和已学习的动作查询。它生成统一的潜动作,动作头则预测机器人动作。

生成的潜动作受到两种方式的监督。首先,利用 L1 损失和余弦相似度损失,将这些动作与冻结的潜动作目标进行对齐。其次,将这些动作输入潜世界模型解码器,以预测未来的语义和几何变化量。这种监督机制将策略生成的潜动作与未来的场景演变联系起来,而机器人动作损失则确保这些动作与可执行的控制指令保持一致。

最终的策略训练目标为:

L_policy = m L_act + λ_align L_align + λ_wm L_wm。

其中,L_act 是机器人动作预测损失,L_align 是潜动作目标匹配损失,L_wm 是潜世界模型的未来动态预测损失。二元变量 m 表示是否存在真实机器人动作。对于已标注动作的演示视频,所有三个损失函数均被使用。对于无动作视频,动作损失函数被屏蔽,而潜动作目标匹配和未来动态预测仍然有效。

4. 训练和推理

在潜动作模型预训练期间,DINOv3 [1] 编码器和深度估计器 [2] 被冻结,仅对潜动作编码器、融合模块和解码器进行优化。在策略训练期间,预训练的潜动作编码器保持冻结状态,以提供稳定的目标。解码器、适配器、视觉语言骨干网络和动作头进行联合训练,使潜世界模型能够适应策略生成的潜动作。

在推理阶段,WALA 仅使用视觉语言骨干网络和动作头。未来观测数据、冻结的潜动作编码器、DINOv3 编码器、深度估计器和潜世界模型解码器均不需要。该推理路径将当前的多视图观测数据、语言指令、机器人状态和动作查询直接映射到可执行的机器人动作。


实验设置

在 RoboTwin 2.0 [5] 和 RoboCasa-GR1-Tabletop [6] 上评估 WALA。RoboTwin 用于衡量“干净”(Clean)和“随机”(Random)设置下的策略性能,而 RoboCasa-GR1-Tabletop 包含 24 项桌面操作任务,涉及多种物体、容器和空间关系。

采用成功率作为主要评估指标。除非另有说明,基准策略(Base Policy)使用与 WALA 相同的视觉-语言主干网络,但仅利用机器人动作监督进行训练;相比之下,WALA 在训练过程中引入潜动作目标匹配和潜世界监督。在部署阶段,WALA 仅使用视觉-语言主干网络和动作头,无需运行 LAM 编码器或潜世界模型。

http://www.jsqmd.com/news/1332644/

相关文章:

  • Flutter+OpenHarmony音乐播放器下载管理实战
  • 3D云渲染平台选择指南:核心指标与实战评估
  • DLSS Swapper终极指南:5步轻松优化游戏性能,免费提升帧率体验
  • 2026哪个牌子的七彩米好吃?中权七色糙米给出高品质答案 - 甄选测评馆
  • 国产操作系统离线安装deb包实战指南
  • Docker部署实战:从零到一构建Spring Boot应用容器化部署全流程
  • 2026杭州美甲学校全品类选型指南:正规合规实力机构盘点+避坑FAQ大全 - 行业观察网
  • 2026乌当区法律文书机构推荐,法律服务机构哪家好?先避开这4个坑,再按5条硬标准去挑 - geo88
  • IT运维实战:网络与系统故障排查指南
  • 分享多模态AI内容玩法,参加新技术赋能融合发展研修交流
  • 2026华为OD面试题063:单词接龙
  • Word多级列表编号混乱的根源分析与一劳永逸的解决方案
  • 阿里云的Token Plan个人版额度消耗太快了吧!!!
  • B站视频下载工具终极指南:免费解锁4K高清和充电专属内容
  • 天津哪家宣传片拍摄公司靠谱?2026年本土服务商实力 - 新闻快传
  • 2026年8月清镇市婚姻家事律师机构哪家好,交通事故律师机构推荐|地址电话核对与到店准备清单 - geo88
  • DeepSeek V4 API 实战指南:从定价策略到性能优化全解析
  • 手把手部署MiniMax H3模型:基于vLLM-Omni打造本地OpenAI兼容API
  • 2026天津飘窗漏水渗水修缮指南|筑宅安房屋修缮,根治高层/老小区飘窗渗漏水难题 - 筑宅安
  • 孕早期减缓妊娠纹产品推荐|刚怀孕的姐妹,这份护肚清单请收好 - 甄选测评馆
  • 终极免费方案:如何让老旧电视变身智能直播盒子
  • IT项目经理如何用敏捷管理思维在快速迭代中突围
  • FigmaCN:3分钟让你的Figma界面全面中文化
  • Windows XP系统下Python 3.4科学计算环境搭建全攻略
  • 普通市民出包亲身经历,盘点深圳可全程看检测的正规奢品商铺 - 奢侈品回收评测
  • 光模块技术解析:从AI算力核心到数据中心网络实战
  • 2026华为OD面试题064:增强的strstr
  • 二维码扫描技术全解析:从原理到安全实践
  • 蓝顿修缮|深耕北方!全资质仓配一站式,屋面防水 + 高端仿石漆一体化 - 峰说城事
  • Sunshine游戏串流:5步轻松打造你的私人云游戏平台