当前位置: 首页 > news >正文

【CoRL 2022】DayDreamer:物理机器人的世界模型学习|从机器人世界模型专家视角

摘要

本文解读 CoRL 2022 论文《DayDreamer: World Models for Physical Robot Learning》。该论文提出把Dreamer 世界模型直接用于真实机器人在线学习,通过融合潜在空间想象异步 actor-learner 解耦多传感器融合,在无模拟器、无示范的条件下从零学习机器人行为,其特别之处在于一个算法、一套超参数通吃 4 台机器人。实验表明四足机器人仅用 1 小时就学会从仰躺状态翻身、站立并行走,双臂抓放 8–10 小时逼近人类水平,为真实世界机器人强化学习建立了强基线。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景:世界模型的四大组件
  • 方法细节
  • 实验设计与结果
    • 三个值得注意的定性发现
    • 潜在想象的可解释性(附录 F)
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • DayDreamer 和 Dreamer 是什么关系?
    • 为什么世界模型能减少真实试错?
    • 同一套超参数真的能通吃所有任务吗?
    • 机器人在学习过程中被推倒怎么办?
    • 世界模型的潜在想象有什么实际用途?
  • 参考链接

论文基本信息

项目内容
标题(英文)DayDreamer: World Models for Physical Robot Learning
标题(中文)DayDreamer:物理机器人的世界模型学习
作者Philipp Wu$^$ · Alejandro Escontrela$^$ · Danijar Hafner$^*$ · Ken Goldberg · Pieter Abbeel
机构University of California, Berkeley
会议CoRL 2022
arXivhttps://arxiv.org/abs/2206.14176
项目网站https://danijar.com/daydreamer

背景与动机

深度强化学习(RL)是机器人学习的常用方法,但它需要大量试错才能学会行为,在真实机器人上成本极高,因此绝大多数机器人 RL 工作依赖模拟器。然而模拟器无法完全捕捉真实世界的复杂度,且训练出的行为不会适应环境变化

主流路线有三类,各有短板:

  • Sim2Real 域随机化:在模拟器中大规模训练后部署(Rusu 2016、Lee 2020、Rudin 2021),或模拟预训练 + 真实微调(Smith 2021)——设计模拟任务耗时,且模拟与真实存在鸿沟;
  • 机器人群集采集:QT-Opt / MT-Opt / Bridge Data 靠大量机器人并行收集经验——硬件成本高昂;
  • 示范与任务先验:VIKING、课程式 RL 等依赖人类专家示范——标注成本高。

真正在物理世界端到端学习的先例很少:Visual Foresight用像素级视频预测 + 在线规划,但需要生成图像、计算昂贵且只适合短时域任务;SOLAR 与 PDDM 学习潜在动力学做规划,但未覆盖跨模态、稀疏奖励的复杂场景。

DayDreamer 的答案是:让机器人学习一个世界模型,把"试错"搬进模型的潜在空间。世界模型从回放数据中学习环境动力学,相当于机器人自学出的快速模拟器;策略在想象中优化,真实环境中的交互需求大幅减少——四足机器人只用 1 小时,机械臂只用 8–10 小时。

从技术脉络看(附录 H):世界模型从 2018 年 World Models 的像素级范式,到 2019 年 PlaNet 提出 RSSM 潜在动力学、2020–2021 年 Dreamer / DreamerV2 在 Atari 上实现潜在想象 RL,再到本文 2022 年首次登上物理机器人,之后 DreamerV3 用单一配置征服 150+ 领域,世界模型也成为 IRIS、UniPi、V-JEPA 2 等具身智能工作的基础设施——DayDreamer 正是这一迁移链条上"从游戏到真实机器人"的关键一环。

研究主线:从问题到结论

图 12:DayDreamer 研究主线(Mermaid 流程图)——问题 → 动机 → 设计 → 方法 → 实验 → 结论

基准/方法设计

DayDreamer 直接沿用 Dreamer 算法本身,不做新算法创新,而是解决"如何在物理机器人上跑起来"的系统问题:

  • 世界模型学习:基于循环状态空间模型(RSSM),由编码器、解码器、动力学网络、奖励网络四部分组成,从回放缓冲区中监督学习;
  • 行为学习:actor-critic 在世界模型的潜在空间中想象 rollout 并优化策略,不需要解码观测,因此可以用 $1.6\times10^4$ 的大批量在单张 GPU 上并行训练;
  • 异步解耦:learner 线程持续训练神经网络,actor 线程并行计算动作与环境交互——这是 20 Hz 高控制率四足环境可行的关键。

图 1:DayDreamer 在线学习流水线——策略采集经验 → 世界模型在回放数据上监督学习 → actor-critic 在潜在空间想象 rollout 优化行为

分类全景:世界模型的四大组件

图 13:世界模型系统四大组件(Mermaid 分类图)——编码器 / 动力学 / 解码器 / 奖励网络

方法细节

世界模型 = 可微的"快速模拟器"。因为感官输入是图像,世界模型预测未来的潜在表示而非像素,既减少累积误差,又支持大规模并行训练。编码器把 RGB、深度、本体感知等多模态输入融合成离散码 $z_t$,动力学网络用循环状态 $h_t$ 预测未来码序列,解码器重建输入提供丰富学习信号并支持人类检查模型预测。

图 2:世界模型学习——encoder 融合多模态感官输入为离散码,RSSM 在给定动作下预测未来码,decoder 重建输入提供学习信号

行为学习 = 潜在空间中的大规模想象。策略网络与价值网络从想象轨迹中学习,奖励由学到的奖励网络预测。行为学习的目标是 $\lambda$-returns:$V_t^{\lambda}=r_t+\gamma((1-\lambda)v(s_{t+1})+\lambda V_{t+1}^{\lambda})$,让策略能够学习超越想象视野 $H$ 之外的长期策略。

图 3:行为学习——在潜在空间以 16K 大批量并行想象 rollout,训练策略网络与价值网络,奖励由学到的奖励网络预测

四个核心设计要素:

  1. 预测潜在表示而非像素:减少累积误差,支持单 GPU 16K 批量;
  2. $\lambda$-returns 想象目标:在想象视野之外仍能学习长期策略;
  3. 梯度估计器按任务选择:连续控制用重参数化梯度,离散动作用 Reinforce 梯度;
  4. 多模态传感器融合:RGB / 深度 / 本体感知统一编码进随机表示,免去人工状态估计。

实现细节(附录 A):代码基于官方 DreamerV2 实现;异步 actor-learner 架构中,learner 持续训练、actor 并行采集;所有实验使用相同超参数(附录 B:RSSM 512 维、32 个离散潜在变量、每类 32 个类别、批量 32×32、想象视野 $H=15$、折扣 $\gamma=0.95$、$\lambda=0.95$、学习率 $10^{-4}$),开箱即用到不同机器人本体。

实验设计与结果

实验覆盖4 台机器人、4 类任务,横跨运动、操作与导航,动作空间、观测模态与奖励结构各不相同:

任务动作 / 频率观测训练时长关键结果
A1 四足行走连续 / 20 Hz关节+姿态1 小时翻滚→站立→行走
UR5 抓放离散 / 2 HzRGB+本体8 小时2.5 件/分,接近人类
XArm 抓放离散 / 0.5 HzRGB-D+本体10 小时3.1 件/分,Rainbow 失败
Sphero 导航连续 / 2 HzRGB2 小时距目标 0.15,持平 DrQv2

每台机器人对应当前类别最强的模型无关基线:四足对SAC(数据高效连续控制)、双臂对Rainbow DQN / PPO(像素离散控制,另有人类操作员基线)、轮式对DrQv2(像素连续控制)。

图 4:实验平台总览——Unitree A1 四足、UR5 与 XArm 双臂、Sphero 轮式机器人

图 5:A1 四足行走——前 5 分钟学会翻滚、20 分钟站立、约 1 小时走出步态;SAC 在数据预算内只会翻滚

图 6:受扰适应——用长杆反复推倒机器人,10 分钟在线学习后学会承受轻推、重推时快速翻身站起

图 7:UR5 多物体抓放——8 小时达到 2.5 件/分,接近人类基线;Rainbow DQN 与 PPO 只学会"抓住就地丢下"

图 8:XArm 抓放——10 小时达到 3.1 件/分,可比人类;Rainbow 收敛到同箱抓放的局部最优

图 9:Sphero 导航——2 小时学会到达并保持目标,平均距离 0.15;与 DrQv2 表现相当

三个值得注意的定性发现

  • 渐进式里程碑:A1 前 5 分钟学会翻身、20 分钟学会站立、约 1 小时走出 pronking 步态;受推后仅 10 分钟就适应;
  • 多模态行为涌现:XArm 学会用绳子把软物体从角落拉出再抓取,而不是只会直线抓取;
  • 持续在线适应(附录 E):日出强光使 XArm 观测域剧变、性能骤降,但约5 小时在线学习后恢复并反超原水平——快于从零重新训练。

图 10:XArm 光照适应——训练时夜间观测(左)与日出强光观测(右)差异巨大;性能骤降后约 5 小时恢复并反超

潜在想象的可解释性(附录 F)

图 11:潜在想象 rollout 可视化——每行一条想象轨迹,UR5 场景中多个物体的动力学被世界模型建模

Oral 信号分析(附录 C):DayDreamer 命中三个创新模式——P6 重新表述为可解对象(真实机器人 RL → 学世界模型 + 潜在想象优化)、P7 制造监督信号(从回放数据自监督预测未来表示)、P11 分解并委托求解器(环境模拟委托世界模型、行为优化委托 actor-critic),证据链来自跨平台泛化与稀疏奖励下的量化结果。

结果对比总结

图 14:四机器人结果对比总结(Mermaid 流程图)——同一套超参全部学会

关键发现

  1. 样本效率数量级提升:四足行走从模拟器数周训练缩短到真实世界1 小时,双臂抓放 8–10 小时逼近人类;
  2. 无模拟器、无示范、无重置:A1 四足直接从仰躺状态端到端学习,这是此前从未实现的设定;
  3. 一套超参通吃 4 台机器人:动作空间、观测模态、奖励结构各异的任务共用同一配置,说明世界模型方法具有通用性;
  4. 基线全面落后:SAC 只会翻滚不会站立行走,Rainbow/PPO 只学会短视的"抓住就地丢下",DrQv2 在导航上与 Dreamer 持平;
  5. 在线学习 = 持续适应:10 分钟适应推倒扰动、5 小时恢复光照剧变并反超,天然支持持续学习设定;
  6. 潜在想象可视化:解码想象轨迹可直接检查策略意图,为世界模型调试提供了工具。

局限性

  • 硬件磨损:数小时在线学习对机器人本体损耗大,可能需要人工干预甚至维修;
  • 长时训练未探明:Dreamer 与各基线在更长训练时间下的性能上限尚不清楚;
  • 任务规模有限:均为单任务、固定环境设定,未涉及多任务复用与复杂场景;
  • 作者展望:把真实世界快速学习与模拟器加速结合,是更具挑战性任务的未来方向。

常见问题(FAQ)

DayDreamer 和 Dreamer 是什么关系?

DayDreamer 没有提出新算法,而是把 Dreamer 世界模型算法首次系统性地搬到真实机器人上,解决物理世界的在线学习问题,验证了"潜在空间想象"在真实硬件上的可行性。

为什么世界模型能减少真实试错?

世界模型从回放数据学习环境动力学,策略在模型潜在空间中想象 rollout 并优化,不需要在真实环境里反复尝试——四足 1 小时、双臂 8–10 小时即学会任务。

同一套超参数真的能通吃所有任务吗?

能。A1(连续控制)、UR5/XArm(离散控制 + 像素)、Sphero(连续控制 + 像素)全部使用相同的超参数配置,这也是论文被称为"强基线"的原因。

机器人在学习过程中被推倒怎么办?

这正是论文的亮点之一:推倒后机器人仅需10 分钟在线学习就能适应,学会承受轻推、重推时快速翻身站起,体现了持续在线学习的鲁棒性。

世界模型的潜在想象有什么实际用途?

除了训练策略,潜在想象还可以解码可视化——直接查看 actor 的意图和世界模型对多物体动力学的建模,是理解和调试模型的重要工具。

参考链接

  • DayDreamer arXiv 论文(2206.14176)
  • DayDreamer 项目网站(视频与代码)
  • Dreamer:Dream to Control(ICLR 2020)
  • DreamerV2:Mastering Atari with Discrete World Models(ICLR 2021)
  • PlaNet:Learning Latent Dynamics for Planning from Pixels(ICML 2019)
  • DreamerV3:Mastering Diverse Domains through World Models(NeurIPS 2023)

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

http://www.jsqmd.com/news/1362627/

相关文章:

  • 2026年针织面料实力厂家甄选:平纹/空气层/罗纹/雪花竹节/卫衣面料优质供应商解析 - 卓企推荐
  • AI Agent 架构设计与多 Agent 协作系统搭建:上下文与工具的职责边界
  • 美团性能优化专项面经:APM实践、列表滑动优化、图片加载优化、编译加速
  • 抖店新店体验分提升策略详解 一件代发商家维护店铺权重实用技巧 - 抖大侠
  • 2026年河南马场垫料刨花机厂家高适配选购推荐指南 - 热点品牌推荐
  • Spring Boot 与源码级原理拆解:接口演进怎样减少返工
  • 数据库索引优化与慢查询分析实战:升级前先做这几项确认
  • Vue3 组合式架构与响应式原理拆解:工具选型别只比较参数
  • 饶阳透水步道砖厂家产品选购全指南 鑫浩达水泥制品(饶阳销售中心) - 热点品牌推荐
  • 准新新能源二手车正规车行联系方式指南:成都同展车多多新能源二手车 - 热点品牌推荐
  • 2026年宁波企业工作服定制哪家好 实测蓝衫防护品质 - 起跑123
  • 通达信缠论量化插件:3分钟实现智能K线分析的完整指南
  • 美团算法高频题面经:反转链表、两数之和、有效括号、最长子串、合并区间
  • AI 云原生后端架构与智能服务网格治理:上下文与工具如何分工
  • 食品级次氯酸钠消毒液热门厂家选择指南:陕西欣诺华生物科技有限公司 - 热点品牌推荐
  • 不锈钢异形非标件选购指南:如何选择可靠的供应商 - 热点品牌推荐
  • Vite 构建链路优化与大型项目工程治理:评审时怎样发现隐性风险
  • 2026 年新发布:孝昌专业的电机回收厂商怎么联系,收废品的老周靠这玩意儿,半年多赚了两万块,你猜他藏了啥门道? - 行业推荐【认证官】
  • 2026优选虎门真皮工具包工厂哪家专业 - 装修教育财税推荐2026
  • 2026年天津管材钢材企业甄选指南:大棚管材、光伏支架、温室材料供应商参考 - 海棠依旧大
  • 2026年宁波企业工作服定制选哪家 蓝衫防护值得考虑 - 起跑123
  • 靠谱新疆特产小零食干果店有哪些 乌鲁木齐市水磨沟区华凌市场粒遇果业商行(新疆联络处) - 热点品牌推荐
  • 北京网站建设 标准型 新翼方案,揭秘中小企业官网搭建背后的真相与实战策略
  • 【Bug已解决】Llama3.2: Allow batch to have 解决方案
  • 吴店选评价高的多联机家电批发门店 枣阳市海晨电器有限公司(吴店服务中心) - 热点品牌推荐
  • 2026年朝阳区奔驰维修公司找哪家 德宝明达汽修(朝阳区联络处) - 热点品牌推荐
  • 2026 年当下,崇明热门的全自动液压纠偏装置供应厂家怎么联系,省料又高效的车间神器,竟是这个全自动液压纠偏装置?-科博瑞液压机械 - 企业官方推荐【认证】
  • React 渲染性能优化与组件设计:接口演进怎样减少返工
  • 选对才省心:2026年国内高品质修剪切水口设备源头厂家哪家强 - 热点品牌推荐
  • 2026年选浙江耐用梯形刀厂家 成都泰奇鑫金属制品(浙江服务中心) - 热点品牌推荐