当前位置: 首页 > news >正文

Transformer Transformer:运动条件下机器人协同设计的统一模型,速度更快、设计更优!

Transformer Transformer:用于运动条件下机器人协同设计的统一模型

该研究由 Huy Ha、Karen Liu、Shuran Song 开展,有相关论文、视频和代码。研究涵盖研究动机、框架介绍、RoboTokens、架构设计、动力学自引导、实验结果、现实应用等方面。

并非所有机器人都生来平等

并非所有机器人都生来平等,而 Transformer Transformer 作为统一模型,能根据操作演示生成针对特定运动优化的完整机器人。例如为 ALOHA2 双手机器人平台设计的抛布机器人,与原始设计相比,将跟踪误差降低了 73%,最大关节速度降低了 30%。这一成果基于 RoboTokens 训练的扩散 Transformer,RoboTokens 是对机器人实体、状态和动作进行统一标记化的方法,相同架构涵盖不同实体空间和用例。其动力学模型通过动力学自引导过程引导实体扩散,三个设计空间的实验表明,该模型能对未见过的奖励和轨迹进行零样本优化,相比进化基线方法,提高了性能并缩短了运行时间。

技术总结视频

有一个 17 分钟的详细介绍视频,也可查看图文版本。

给定操作任务,哪种机器人最优?

机器人的实体形态决定其擅长的任务,即便有出色策略,糟糕的实体形态也会受限。具体问题是,给定目标末端执行器的运动和奖励函数,希望生成完整的机器人实体及控制器,这被称为运动条件下的机器人协同设计。

演示、生成、验证

框架将机器人协同设计重新定义为三步过程:演示期望的末端执行器运动,模型生成优化后的实体,同一模型验证该设计并控制机器人。同一个网络扮演生成器、评估器和跨实体控制器三个角色,通过对机器人进行统一标记化联合训练实现。论文分为统一的机器人表示(RoboTokens)、统一的架构(Transformer Transformer)和统一的训练目标(动力学自引导)三部分。

RoboTokens:统一的机器人表示

每个机器人变成类型化的标记序列,蓝色标记编码实体,橙色标记编码动力学。RoboTokens 是涵盖所有实体的共享词汇表,有完整性、灵活性、一致性、可扩展性、可优化性等关键设计目标。对 MuJoCo Menagerie 中的 11 个机器人进行标记化,每个机器人变成 28 - 101 个 RoboTokens 的序列,且 RoboTokens 比 MJCF 文本紧凑 27 - 110 倍。

Transformer Transformer:统一的架构

该模型是基于 RoboTokens 训练的扩散 Transformer,采用 DDIM4 噪声调度。通过改变掩码标记,同一个网络可扮演不同角色,相同权重在动力学上进行联合训练。其标题有双关含义,第一个“Transformer”指机器人,第二个指自注意力架构。它有感知实体的控制器和多样化机器人类别的生成器两个功能,前者能根据机器人调整控制策略,后者能从高斯噪声中扩散出完整机器人。

动力学自引导:零样本处理奖励

为解决为模型未见过的奖励函数生成高奖励机器人的问题,可将模型预测输入用户奖励函数得到预测奖励,并行多次运行模型选优。还可计算预测奖励梯度注入扩散过程,即动力学自引导。以随机生成的四足机器人为例,模型能根据不同奖励条件生成不同机器人,实现零样本处理奖励。对于运动的分布,扩散组合方法可实现为整个任务优化机器人,在 UMI 双手机器人洗碗数据集上测试,模型生成针对整个预留分布优化的机器人并验证设计。

设计更优,速度更快

与随机和 CMA - ES 两个基线方法比较,Transformer Transformer 在有更多推理种子时能生成更好设计,性能约一分钟后达平台期。在三个设计空间和多个奖励函数下,其零阶和动力学自引导变体生成奖励更高的设计,速度比 CMA - ES 快几个数量级,原因是对候选设计进行 GPU 并行化处理和非自回归扩散可并行评估整个过程。

现实应用:ALOHA 上的布抛掷任务

为测试系统,选择 ALOHA2 上的动态布料展开任务。原始 ALOHA 设计难以跟踪轨迹,模型针对“跟踪速度”奖励优化 ALOHA 设计后,制造出的优化设计有更长的连杆长度和倒置安装两个变化,且优化后的设计关节轨迹更平滑。

局限性与未来工作

存在几何形状和场景、控制器迁移、测试时扩展的平台期、数据生成成本等方面的局限性,扩展到复杂几何形状和场景上下文、提升控制器泛化能力、提高奖励预测准确性和探索替代推理方案、降低数据生成成本是未来研究方向。

参考文献

包括 Peebles, W., & Xie, S.、Zhao, T. Z., Kumar, V., Levine, S., & Finn, C. 等众多文献。完整参考文献列表可在论文中查看。

http://www.jsqmd.com/news/1292455/

相关文章:

  • 原子量子计算机:从量子比特原理到实际应用场景解析
  • 喷码机数据采集到MES系统的解决方案
  • STM32外部中断实现独立按键检测:从轮询到事件驱动的效率优化
  • Claude依然优秀,但开发者已不再信任Anthropic
  • AI Agent Skills开发指南:从原理到实践
  • AI搜索优化GEO系统:从模块拆解到数据流的架构设计解析(架构设计篇) - 汇聚至此
  • 复杂学术 PDF 翻译故障排查,公式、图表和引用该怎么检查
  • AI 应用工程:Tool、MCP、Skill 与 Workflow 如何接入 Agent?——搭建一个可运行的需求影响面分析 Agent
  • 基于Proteus的STM32环境监测系统仿真:从传感器模拟到ADC采集全流程解析
  • TI嵌入式开发实战指南:从MSPM0入门到I2C/SPI通信调试
  • Qt应用动态语言切换:实现不重启实时更新界面文本
  • 1:12遥控液压挖掘机模型:3D打印与CNC加工的多工艺集成实践
  • C语言扫雷递归展开优化:从栈溢出到队列BFS的算法演进
  • 一加15顶配版游戏性能实测:骁龙8 Gen 4散热与帧率稳定性分析
  • YOLO目标检测训练与测试工具 YOLO一键训练工具
  • Unity道路系统高效构建:EasyRoads3D核心功能与实战指南
  • 库存管理系统构建:数据驱动的仓储数字化管控架构
  • 读懂大模型六大核心底层概念:从原理到落地应用
  • C++与Python实现Modbus TCP客户端:Qt框架下的性能与效率抉择
  • 照片怎么改大小kb手机软件:会议PPT插图撑爆后的处理日记 - AI测评专家
  • Linux CAN应用编程实战:从Socket CAN到嵌入式通信开发
  • WeChatPad终极指南:如何简单三步实现微信双设备同步登录
  • Node.js安装全流程
  • 布隆过滤器详解:从原理到 Go 实现,解决缓存穿透问题
  • AI改写消费决策链路,出海品牌如何借合作伙伴营销破局?
  • 深入解析Windows C++ DLL导出技术:从原理到实战避坑指南
  • Xshell:从零到精通的SSH终端工具实战指南
  • Java逻辑运算符深度解析:从短路机制到实战应用
  • [虾说AI]白话全解上下文工程一:什么是上下文工程
  • Simulink仿真实现PMSM脉振高频注入无感控制:原理、建模与调试