当前位置: 首页 > news >正文

大疆具身智能面试,居然考了一道LLM微调题

前面八篇把大疆的传统强势方向都聊了一遍,从飞控到视觉到导航,基本覆盖了他们过去十年的核心技术栈。但这第九篇要聊的方向跟前面画风完全不同——具身智能算法工程师,这是大疆近一两年新开的岗位,面试内容直接跳到了VLA模型、多模态大模型和机器人学习的交叉地带。

说白了,大疆也看到了RT-2、OpenVLA这些工作带来的范式变革。传统的感知-规划-控制pipeline正在被端到端的大模型方案挑战,大疆不可能不布局。这个岗位的面试既有传统机器人学的底子,又有深度学习和LLM的内容,混合度非常高。

VLA模型:从RT-1到OpenVLA的技术脉络

具身智能的核心是VLA(Vision-Language-Action)模型,面试里这是必考方向。

面试官问:"RT-1、RT-2和OpenVLA这三个模型的核心区别是什么?它们分别解决了什么问题?"

RT-1(Robotics Transformer 1)是Google在2022年发的工作,思路是把机器人的动作(机械臂末端位姿、夹爪开合)tokenize成离散的动作token,然后用一个Transformer模型以图像和语言指令为输入自回归预测动作token。本质上就是把机器人控制变成了一个"看图说话+做动作"的多模态序列预测问题。

RT-2的关键改进是把动作token空间和VLM(Vision-Language Model)的词汇表统一了。RT-2用的是PaLI-X或者PaLM-E这种已经预训练好的视觉语言模型做底座,把机器人动作token直接嵌入到VLM的token空间里。这样模型不仅继承了VLM的视觉

http://www.jsqmd.com/news/1272041/

相关文章:

  • Gemini 3.1 Pro:程序员效率提升利器与AI编程新趋势
  • 动物森友会存档编辑神器:5分钟掌握NHSE终极指南
  • 9款开源AIGC工具实测:Deadline救星还是坑?
  • 生命涌现的小龙虾技能之【Outdoor Sports Event Risk Analysis Tool | 户外体育赛事风险分析工具】简介
  • MySQL基础-从建库建表到增删改查
  • 【工业级文本摘要Prompt标准】:基于1376份真实业务文档测试,准确率提升41.6%的6大结构范式
  • LLM 效果不好?可能是 Prompt 写错了!
  • 开源模型免费API实战:Llama、Qwen调用指南与工程实践
  • Prompt工程团队组建与管理实战指南
  • C++音频编程实战:从零实现《追光者》音乐合成器
  • Blazor数据可视化实战:ComponentOne趋势线应用
  • 大疆仿真平台面试,Sim2Real迁移这道题难住了九成候选人
  • 2026 年 7 月新发布:河北有实力的基建项目临建房供应厂家怎么联系,你以为它只是临时板房?居然藏着基建项目里少有人知的省钱秘密?-旭华建筑工程 - 行业推荐【认证官】
  • OpenClaw开源工具集:代码分析与自动化处理实战指南
  • 告别臃肿!G-Helper:你的华硕笔记本性能管家,10MB内存搞定一切
  • 鲸鱼算法优化BP神经网络的时间序列预测实践
  • 大数据用户画像系统设计与工程实践
  • 提示词整理效率提升300%的秘诀:用「意图-约束-输出」三维标签法重构你的提示库(附可落地Checklist)
  • TMS320C54x DSP时钟配置实战:PLL原理、CLKMD寄存器详解与避坑指南
  • WebRTC信令系统设计与优化实战指南
  • MATLAB实现电力系统连续潮流分析与PV曲线绘制
  • 动态规划求解最长公共子序列:从原理到C++实现与优化
  • 基于非对称纳什谈判的微电网电能共享Matlab实现
  • 实测盘点:抠图app有哪些值得装、手机免费电脑专业全都有 - 办公小帮手
  • 抖音无水印下载终极教程:3分钟学会批量保存完整视频资源
  • Qwen3.5开源大模型:轻量架构与高效推理实践
  • AIF2硬件限制下软件实现4B/5B编码的快速CM以太网通道
  • AO3镜像站:三步解锁全球最大同人创作平台的终极指南
  • 三足鼎立!国内实景视频孪生三大顶尖技术流派格局
  • C语言函数重载实现:基于_Generic的零开销方案