当前位置: 首页 > news >正文

【AAAI 2026】ReconVLA:以重建式视觉监督实现精准机器人操纵|从机器人视觉表征对齐视角

摘要

本文解读 AAAI 2026 论文《ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver》。该论文提出ReconVLA,一个以重建式视觉监督实现隐式 grounding 的视觉-语言-动作(VLA)模型,通过融合注视区域(gaze region)重建扩散 Transformer大规模视觉预训练,让机器人像人眼一样聚焦目标区域,解决传统 VLA 视觉注意力分散导致的操纵失准问题。实验表明CALVIN ABC→D 第 5 子任务成功率 64.1%、平均完成长度 3.95/5,ABCD→D 平均 4.23/5,并在真机未见目标上保持可用(基线近乎 0%),为具身智能的视觉表征对齐提供了重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
  • 实验设计与结果
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • ReconVLA 与显式 grounding 方法(RoboGround、VIP)有何区别?
    • 为什么要重建"注视区域"而不是整幅图像?
    • 思维链 grounding(输出 bbox)为什么效果差?
    • 预训练数据是怎么得到的?需要动作标注吗?
    • ReconVLA 在真实机器人上的表现如何?
    • ReconVLA 的损失函数包含哪几项?
  • 参考链接

论文基本信息

项目内容
标题(英文)ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
标题(中文)ReconVLA:以重建式视觉监督实现精准机器人操纵
作者Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, Haoang Li
机构香港科技大学(广州)· 西湖大学 · 浙江大学 · Monash University
会议AAAI 2026
arXivhttps://arxiv.org/abs/2508.10333
项目网站https://zionchow.github.io/ReconVLA/

背景与动机

传统 VLA 模型(RT-2、OpenVLA、RoboFlamingo、VLAS、UniVLA 等)只监督动作输出,模型虽然能在多模态理解基础上执行动作,但视觉注意力往往呈弥散状态,无法聚焦目标物体。论文通过注意力可视化发现:在杂乱场景与长程任务中,模型视觉 token 获得的注意力远低于语言 token,常常聚焦错误区域,导致操纵错误的对象。

为什么这个问题重要?精准的视觉 grounding 是 VLA 实现精确抓取的基础,尤其体现在杂乱环境和长程任务中。例如"把西瓜放进黄色碗里"这类指令,基线模型注意力分散在无关位置直接导致任务失败。

现有 grounding 工作分两类,都未从根本上修正注意力分配:

  • 显式 grounding(RoboGround、VIP):借助 LISA、YOLOv11 等外部专家模型分割目标并作为额外输入,增强感知但不提升策略自身的 grounding 能力,且整图+裁剪图的输入冗余反而损害空间理解。
  • 思维链 grounding(ECoT、GraspVLA):先输出边界框坐标再输出动作,坐标形式难以引导精确操纵,直接回归坐标与动作数值对自回归 VLA 训练挑战极大。

下表给出 CALVIN ABC→D 上 10 个代表性基线的完整结果(附录 D 完整基线表)。这个设置要求模型在未见背景(环境 A/B/C 训练、环境 D 测试)上完成 5 个连续子任务,是检验泛化的硬基准:

Method1/53/55/5Avg Len
UniPi (NIPS'23)56.08.04.00.92
SuSIE (ICLR'24)87.049.026.02.69
GEVRM (ICLR'25)92.054.026.02.83
GR-1 (ICLR'24)85.459.640.13.06
Vidman (NIPS'24)91.568.246.73.42
CLOVER (NIPS'24)96.070.845.43.53
VLAS (ICLR'25)87.240.919.62.40
RoboFlamingo (ICLR'24)82.446.623.52.47
OpenVLA (CoRL'24)91.362.043.53.27
UniVLA (RSS'25)95.575.456.53.80
ReconVLA (ours)95.676.964.13.95

从历史脉络看(附录 H),VLA 领域经历了 RT-2(2023)确立范式 → 生成式操纵方法(UniPi、SuSIE、GR-1、3D-VLA 预测未来帧增强规划)→ 显式/CoT grounding 与 ROSS 重建式视觉指令微调(2024)→ ReconVLA(2026)首次把注视区域重建作为 VLA 隐式视觉监督。ReconVLA 因此被视为"机器人视觉表征对齐"方向的奠基工作,后续 Spatial Forcing(ICLR 2026)等沿此脉络发展。

研究主线:从问题到结论

图 7:ReconVLA 研究主线流程图(Mermaid)——问题→动机→设计→方法→实验→结论,边标注关键证据。

基准/方法设计

核心洞察:人眼在操纵物体时只聚焦视野中的一小块区域(即注视行为),其余部分模糊。ReconVLA 把这个机制建模为重建目标——让模型从噪声中重建目标操纵区域(gaze region),重建过程成为视觉输出的隐式监督信号,迫使模型把视觉注意力集中到正确目标,同时增强该区域的细粒度感知,并在长程任务中隐式促进子任务规划。

图 1:观察画面、gaze region 与注意力图可视化。长程任务 "stack blocks" 中,ReconVLA 自适应调整 gaze region,把视觉注意力引导到正确目标,完成"先抓起蓝块、再叠到粉块上"的连续操作。

三种 grounding 范式对比(附录 A):显式范式(EG)用 YOLOv11 检测目标并联合输入整图/裁剪图,平均长度 3.61;思维链范式(CG)输出边界框坐标,仅 0.63;ReconVLA 的隐式范式(IG)直接监督视觉输出,达到 3.95。直接监督视觉输出既避免了输入冗余,又绕开了坐标回归的联合训练难题。

图 2:三种 grounding 范式概念对比。(a) 显式:外部 grounding 专家 + 整图/裁剪图输入;(b) CoT:先输出 bbox 坐标再输出动作;(c) 隐式(本文):通过重建过程把关键区域作为隐式视觉监督。

分类全景

图 8:VLA 视觉 grounding 方法分类全景(Mermaid)——显式 / CoT / 隐式 / 生成式四类范式及其代表方法。

方法细节

ReconVLA 由重建部分动作部分组成,基于 LLaVA-7b(Qwen2-7b 语言模型 + SigLIP-so400m-patch14-384 视觉编码器)构建:

图 3:ReconVLA 架构:多视角图像 + 文本指令输入;动作部分输出离散动作 token;重建部分以 reconstructive tokens 为条件,从噪声 $z_t$ 去噪重建 gaze region 场景 token $z_0$。

  • 重建目标:只重建目标操纵区域而非整幅图,模拟人眼注视;在潜在空间重建(冻结 VAE 视觉 tokenizer 提取场景 token),避免像素级冗余,去噪过程促使模型捕获内在特征而非克隆 RGB 值。
  • 扩散重建:轻量扩散 Transformer(DiT)作为去噪器,以模型视觉输出 $h_R$ 为条件,从噪声 $z_t$ 恢复 gaze region token $z_0$。重建损失采用去噪均方误差形式:$L_{visual} = E[||D(z_t; h_R, t) - \epsilon||^2]$。
  • 总损失:$L = L_{action} + L_{visual}$,其中 $L_{action}$ 为自回归动作预测的交叉熵,$L_{visual}$ 为重建项。
  • 指令前缀交错(附录 F):指令 token 置于图像 token 之前,图像 token 通过因果注意力融合指令信息,保证模型处理与指令目标对应的视觉 token,且不损害语言建模能力。
  • 大规模视觉预训练:预训练数据来自 BridgeV2、LIBERO 与 CALVIN,用微调后的 Grounding DINO 自动分割指令目标区域,形成整图/裁剪图配对数据,共10 万+ 轨迹、200 万样本。预训练与微调均同时回传重建与动作梯度,保持优化目标一致性;预训练不依赖动作数据,原则上可融入任意规模的互联网视频实现 scaling。

实验设计与结果

评测协议:CALVIN 基准基于 PyBullet 仿真与 Franka Panda 机械臂,含 34 个任务、4 个环境(A/B/C/D),长程挑战为 5 个连续子任务,500 次 rollout 评估各子任务成功率与平均完成长度。真机使用 6-DoF AgileX PiPer 机械臂、RealSense D515(Eye-on-Base)与 ORBBEC Dabai(Eye-on-Hand)相机,4 个任务(水果入碗、叠碗、翻杯子、清理桌面)各约 150 条轨迹、20 次测试,并替换为未见目标检验泛化。

图 4:真机实验设置与四个代表性任务:Stack bowls、Put fruit into bowl、Flip cups、Bus table。目标物体与背景颜色均含变体以测试泛化。

主结果(CALVIN ABC→D):ReconVLA 第 5 子任务 64.1%、平均长度 3.95,全面超越 CLOVER(45.4%、3.53)、UniVLA(56.5%、3.80)与 OpenVLA(43.5%、3.27),在最后子任务上分别领先 18.7、7.6、20.6 个百分点。ABCD→D 更困难设置下平均完成 4.23/5、首任务 98.0%,超过 GR-1(4.21)与 RoboFlamingo(4.08)。

范式对比(附录 A)

Paradigm1/53/55/5Avg Len
Baseline(无 grounding)88.863.749.03.36
EG(YOLOv11 裁剪图输入)94.470.950.23.61
CG(CoT 输出 bbox)47.01.60.00.63
IG(本文)95.676.964.13.95

消融实验(附录 B)

Variant1/53/55/5Avg Len
Full(重建 + gaze + 预训练)95.676.964.13.95
去掉预训练96.876.958.23.85
去掉 gaze 区域(重建全图)89.867.746.53.42
去掉重建(纯动作基线)88.863.749.03.36

消融显示:预训练贡献最大(平均长度 +0.53),因为未见测试环境下定位目标并重建本身极难,大规模预训练显著提升视觉生成泛化;重建 gaze 区域优于重建全图——聚焦目标避免操纵错误物体,而全图像素冗余在未见场景下难以重建。

ABCD→D 完整对比(附录 E):3D-VLA 0.70 → GR-1 4.21 → VLAS 3.70 → RoboFlamingo 4.08 →ReconVLA 4.23

注意力可视化:指令 "put the watermelon into the yellow bowl" 下,基线注意力高度分散导致任务失败;ReconVLA 精准聚焦西瓜。最难任务 stack block 成功率从 59.3% 提升到 79.5%(+20.2%)。

图 5:CALVIN 与真机上的注意力图对比:第 1 行基线注意力分散或聚焦错误区域导致动作失准;第 2 行 ReconVLA 借助视觉监督信号聚焦目标区域,精确完成操作。

真机结果:ReconVLA 在水果入碗与叠碗上接近或超过 90%,四个任务全部优于 OpenVLA 与 PD-VLA;未见目标上 OpenVLA/PD-VLA 近乎 0%,ReconVLA 凭借大规模混合数据预训练仍能成功 grounding 并完成任务。

图 6:真机多任务结果:4 个已知任务 + 2 个未见任务的成功率。ReconVLA 在 Put Fruit into Bowl 与 Stack Bowls 上接近或超过 90%,在未见任务上显著优于 OpenVLA 与 PD-VLA。

结果对比总结

图 9:结果对比总结(Mermaid)——第 5 子任务成功率 64.1%,分别领先 CLOVER 18.7pp、UniVLA 7.6pp、OpenVLA 20.6pp,真机未见目标仍可用。

关键发现

  1. 注意力分散是操纵失准的根因:注意力可视化显示传统 VLA 视觉 token 获得的注意力远低于语言 token,在杂乱/长程场景中聚焦错误区域。
  2. 隐式 grounding 全面胜过显式与 CoT:同基线受控对比 IG 3.95 > EG 3.61 > Baseline 3.36 ≫ CG 0.63(平均完成长度)。
  3. 重建 gaze 区域优于重建全图:去掉 gaze 区域后平均长度从 3.95 降至 3.42,聚焦目标物体避免操纵错误对象。
  4. 大规模预训练带来 0.53 平均长度增益:10 万+ 轨迹、200 万样本(BridgeV2/LIBERO/CALVIN + Grounding DINO 自动配对)显著增强未见环境的重建泛化。
  5. 精确操纵大幅提升:stack block 任务成功率 59.3% → 79.5%(+20.2%)。
  6. 真机未见目标泛化:OpenVLA/PD-VLA 在未见目标上近乎 0%,ReconVLA 仍可成功 grounding 并完成动作。

局限性

  1. 依赖 Grounding DINO 标注质量:预训练数据的 gaze region 由检测器自动生成,标注质量受检测器限制。
  2. 真机评估规模有限:4 个任务、每任务 20 次测试,统计显著性空间有限。
  3. 未见场景仍有挑战:unseen 环境下定位与重建难度大,预训练缓解但未消除。
  4. 重建计算开销:扩散去噪增加训练/推理计算,高频控制场景需权衡延迟(作者展望:借助自动数据处理流水线融入互联网视频实现 scaling)。

常见问题(FAQ)

ReconVLA 与显式 grounding 方法(RoboGround、VIP)有何区别?

显式方法依赖 LISA、YOLOv11 等外部专家分割目标并作为额外输入,未提升策略自身的 grounding 能力,且整图+裁剪图的输入冗余损害空间理解;ReconVLA 直接监督视觉输出,通过重建目标区域隐式完成 grounding,无需额外输入或输出。

为什么要重建"注视区域"而不是整幅图像?

重建整图面临像素冗余,在未见场景下极难完成;只重建目标操纵区域模拟人眼注视行为,引导注意力聚焦正确目标、增强细粒度感知,消融显示重建 gaze 区域(3.42)明显优于重建全图的效果。

思维链 grounding(输出 bbox)为什么效果差?

坐标形式不足以有效引导模型精确操纵目标位置,且直接输出精准坐标与动作数值对自回归 VLA 的训练提出挑战,CALVIN 上平均完成长度仅 0.63。

预训练数据是怎么得到的?需要动作标注吗?

预训练数据来自 BridgeV2、LIBERO、CALVIN 开源机器人数据集,用微调后的 Grounding DINO 自动分割指令目标区域,生成整图/裁剪图配对数据;重建预训练不依赖机器人动作数据,因此原则上可以融入任意规模的互联网视频。

ReconVLA 在真实机器人上的表现如何?

4 个真机任务中水果入碗、叠碗接近或超过 90% 成功率,全部优于 OpenVLA 与 PD-VLA;在训练中未出现过的目标物体上,基线几乎全部失效,ReconVLA 仍能正确 grounding 并完成任务,展示了视觉泛化能力。

ReconVLA 的损失函数包含哪几项?

总损失为动作预测交叉熵 $L_{action}$ 与注视区域重建项 $L_{visual}$ 之和;其中重建项为扩散去噪均方误差,去噪器以模型视觉输出为条件从噪声恢复 gaze region 的场景 token。

参考链接

  • ReconVLA 项目主页(含视频与演示)
  • arXiv 论文页:ReconVLA (2508.10333)
  • RT-2:Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  • OpenVLA:An Open-Source Vision-Language-Action Model
  • GR-1:A GPT-style Model for Robot Visual Manipulation
  • Grounding DINO:Marrying DINO with Grounded Pre-Training
  • ROSS:Reconstructive Visual Instruction Tuning

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

http://www.jsqmd.com/news/1361431/

相关文章:

  • AR-1106麦距设计:TDOA量化下限与空间混叠上限
  • 大模型系列——解读RAG(检索增强生成)2万字详解
  • Fusion开发常见问题解答:新手到专家的进阶之路
  • Redis缓存与分布式锁实战指南
  • 戴南优质的316L无缝管厂商怎么选?认准江苏巨登不锈钢管业有限公司(戴南服务中心) - 热点品牌推荐
  • 2026 实测讲解:星途法考三位一体督学服务,真的能解决备考拖延吗? - 优企甄选
  • 主题乐园运营中的异常值处理与数据优化
  • Linux exec 命令详解
  • TripoSR技术深度解析:单图像快速3D重建的实现原理与架构设计
  • 专家移植技术揭秘:fuse-1 Lite如何融合LFM2.5与Qwen3.6实现高效编码
  • 终极指南:通过Pymaker Python API轻松交互Maker Protocol智能合约
  • 2026年盒马提货券回收到底值不值?手里有券的人一定要看看 - 沃卡回收
  • OPB-Skills:91个AI技能模块,构建你的专属智能工作流
  • 从单一到多维:ECharts多坐标系组合的终极指南
  • OfficeCLI:重新定义AI办公自动化的下一代工具链
  • YOLT核心功能解析:车辆、建筑与机场检测一网打尽
  • 问GKG矿用开关柜生产商推荐几家重技术交付2026找金山门科技有限公司 - 热点品牌推荐
  • 本色PEEK棒批发厂家推荐怎么选深圳市鸿泰锦悦科技有限公司 - 热点品牌推荐
  • SpringBoot+Vue实习管理系统全栈开发实战
  • 如何快速配置electerm主题:5个提升终端体验的终极技巧
  • Kubeflow Pipelines技术深度解构:从开发者体验看机器学习工作流编排的实现哲学
  • Python上下文管理器:优雅实现资源管理与异常处理
  • Prime Agent框架:基于RLMF的大模型自改进技术实践指南
  • 如何为PAPermissions贡献代码?开发者指南与贡献流程详解
  • RedisInsight终极指南:5个核心功能让你告别Redis命令行烦恼
  • 上街区卫生间防水漏到楼下维修公司指南河南帅旗防水工程有限公司上街区联络处 - 热点品牌推荐
  • #戴南专业冷拔工业管供应商优选江苏巨登不锈钢管业有限公司(戴南运营中心) - 热点品牌推荐
  • Python 如何使用 MySQL 的事务
  • .NET异步监控的3个关键预警机制与实战方案
  • 别再把权限写进提示词:Agent 外部控制面的可运行设计