具身智能之DualVLN详解:2 Hz 负责认路,30 Hz 负责避障——如何拆开推理与控制
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
魔方AI空间
猫先生
从零走向AGI
面试面经
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
视觉语言导航(VLN)正在经历一个明显的矛盾:越大的视觉语言模型越擅长理解长指令、地标和空间关系,却越难以高频运行;而机器人面对行人和近距离障碍时,恰恰需要毫秒级更新动作。若让一个 7B VLM 每一步都输出“左转、前进、右转”,不仅延迟高,轨迹还容易断断续续。
《Ground Slow, Move Fast》提出DualVLN,把导航明确拆成两个异步系统:System 2 用 Qwen2.5-VL-7B 以约 2 Hz 做语义推理,输出图像中的像素目标及其隐式语义表示;System 1 用轻量 Diffusion Transformer(DiT)以约 30 Hz 读取新 RGB 画面,把旧目标持续改写成 32 个平滑、可避障的轨迹点;更下层的控制器再以 200 Hz 跟踪轨迹。
这种设计在 R2R-CE Val-Unseen 上取得 64.3% 成功率,相比此前的 StreamVLN 提升 7.4 个百分点;在 RxR-CE 上取得 61.4%,提升 8.5 个百分点。论文还构造了带动态人形智能体的 Social-VLN,并把同一模型部署到 Turtlebot4、Unitree Go2 和 G1。不过,实验也显示“能绕人”距离“懂社交”还有很远:进入 Social-VLN 后,DualVLN 的成功率从 64.3% 降到 37.2%,人类碰撞率仍有 35.4%。
猫先生认为,DualVLN 最值得关注的不是把“快慢思考”这个比喻搬到机器人上,而是给 VLM 与控制策略设计了一个更合适的接口:大模型不必给出每一步动作,只需给出可解释的中期方向;小模型也不必重新理解整条指令,只需在高频视觉反馈下把方向变成安全轨迹。这比单纯把 VLM 加速更接近真实机器人的系统约束。
- 论文标题:Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation
- 论文地址:https://arxiv.org/abs/2512.08186
- OpenReview:https://openreview.net/forum?id=GK4rznYwhn
- 项目主页:https://internrobotics.github.io/internvla-n1-dualvln.github.io/
- GitHub:https://github.com/InternRobotics/InternNav
- 模型权重:https://huggingface.co/InternRobotics/InternVLA-N1-DualVLN
- 训练数据:https://huggingface.co/datasets/InternRobotics/InternData-N1
图 1:System 2 以低频率完成像素目标定位,System 1 高频生成连续轨迹,并在动态行人场景中及时调整。来源:原论文 Figure 1。
原文脉络
论文第 1 节从 VLM 导航的延迟、离散动作和动态避障困难切入。第 2 节回顾 VLN、视觉导航与机器人双系统。第 3 节是方法主体,依次讲 System 2 的像素目标定位、显式与隐式目标接口,以及 System 1 的异步扩散轨迹策略。第 4 节单独提出 Social-VLN,第 5 节从连续仿真、物理仿真、真机跨本体和消融四个层面验证方法。第 6 节总结,附录补充数据构造、训练参数和注意力可视化。
1—2. 问题背景:大模型的时钟跟不上机器人
现有 VLM 导航大致有两条路线。一类把导航写成视觉问答,让模型反复输出离散的前进、转向和停止动作;另一类直接从 VLM 隐藏特征预测连续轨迹。前者容易解释,也能继承语言模型的知识,但动作短视且推理慢;后者更接近端到端控制,却把大模型推理与低层动作绑定在同一频率上。
同步设计在静态基准里尚可工作,进入真实环境后就会暴露问题。VLM 推理期间,机器人、相机和行人仍在运动;等动作到达时,画面已经变了。若降低控制频率,机器人会对突然出现的障碍反应迟钝;若提高大模型调用频率,算力和延迟又难以承受。
DualVLN 的核心假设是:语义决策和局部控制并不需要共享同一时钟。“穿过厨房后在沙发旁右转”这种全局判断可以慢一些,而“前方有人、轨迹向左偏 20 厘米”必须快速更新。论文因此把前者交给 System 2,把后者交给 System 1,并通过像素目标和 VLM 隐藏表示连接二者。
3. Method:Ground Slow,Move Fast
图 2:System 2 根据指令、历史图像和当前画面选择调整视角或输出二维目标;System 1 融合目标、旧画面与最新画面,生成连续轨迹。来源:原论文 Figure 2。
3.1 System 2:先找到“最远可见目标”
System 2 以 Qwen2.5-VL-7B 为基础,输入语言指令、历史第一视角 RGB 和当前画面,输出三类结果:
- 当前视角不合适时,执行左转、右转、抬头或低头,每次调整 15°;
- 路线可见时,输出图像平面上的二维像素坐标;
- 判断抵达终点时,输出
STOP。
训练像素目标时,作者先把三维专家轨迹投影到当前相机画面,再借助深度信息剔除被遮挡的点,选择最远的可见轨迹点作为监督信号。这里的“最远”很关键:若只预测眼前一步,大模型仍会被迫频繁调用;选择中期目标,则能给 System 1 留出一段自主行动空间。
二维投影并不总是成立。机器人面朝错误方向时,未来路线根本不在视野内;相机过高时,地面目标也可能被遮挡。因此,System 2 可以先主动环视或低头,再输出坐标。附录进一步说明,它一次最多可预测连续 4 个转向动作,即最多调整 60°。
System 2 先进行全参数微调:视觉编码器和语言主干均解冻,AdamW 学习率为 2×10⁻⁵,批大小 128,共训练 14000 步。显式坐标使高层决策可观察、可监督,也能直接检查模型到底想往哪里走。
3.2 为什么同时需要显式像素目标与隐式目标
单个二维坐标太“薄”。同一个像素可能表示门洞中央、桌子旁的空隙或远处走廊,但坐标本身不包含指令、历史画面、地标和可通行性等语义。若直接把坐标投影成三维点,再交给传统 point-goal planner,VLM 与控制器仍是松散拼接。
作者在 System 2 输出像素目标后追加 4 个可学习查询 token。它们读取包含指令、历史图像、视角调整、当前画面和像素坐标的完整上下文,形成隐式 latent goal。第二阶段冻结 QwenVL,只训练这 4 个查询和 System 1。于是两种接口各负其责:
- 显式像素目标回答“图像中往哪里走”,便于监督、解释和跨场景泛化;
- 隐式目标表示携带“为什么往那里走、当前上下文是什么”,给局部策略更丰富的条件。
这是一种有意保留“中间瓶颈”的端到端学习:接口不是完全手工,也不是不可见的黑盒特征。
3.3 System 1:用新画面修正旧目标
System 1 是一个紧凑的 flow-matching DiT,一次生成 32 个等间隔轨迹点。视觉主干来自 Depth Anything V2-Small,DiT 的隐藏维度为 384,包含 12 层、6 个注意力头。它的输入有两部分:System 2 低频输出的 latent goal,以及相机持续提供的高频 RGB。
异步系统最难处理的是目标过期。假设 System 2 在时刻 t 根据一张画面给出目标,System 1 到 t+k 时已经向前走了一段,若仍机械执行旧轨迹,就无法估计已走距离,也难以绕开刚出现的行人。
为此,System 1 同时编码 System 2 当时看到的旧帧和当前新帧,用自注意力融合时间变化,再通过 Q-Former 压缩为 32 个视觉 token,作为 DiT 的高频条件。它并不等待 System 2 再次“想完”,而是持续根据新画面重生成轨迹。System 2 约 2 Hz、System 1 约 30 Hz、控制器 200 Hz,三层各自运行。
第二阶段只使用像素目标样本训练,离散专家动作被插值成 32 个平滑轨迹点。学习率为 1×10⁻⁴、批大小 128,共 15000 步。数据缩放实验显示,System 1 使用 1% 的轨迹已经有竞争力,10% 左右接近饱和;真正“吃数据”的仍是负责泛化的 VLM。
猫先生认为,这套架构最漂亮的地方是承认了异步带来的旧信息,而不是假装两个模型总能拿到同一时刻的状态。旧帧—新帧配对让 System 1 学会解释“目标是在什么画面下提出的”,相当于给高低层通信附带了时间上下文。
4. Social-VLN:会避开障碍,不等于会与人共处
图 3:人形智能体从正面接近、在狭窄通道中相遇、多人同时出现或穿越路口等典型情形。来源:原论文 Figure 3。
标准 R2R-CE 和 RxR-CE 主要是静态室内环境,难以评价机器人遇到行人后能否绕行并回到原任务。论文因此在 R2R-CE 与 Habitat 3.0 上构造 Social-VLN:把一个或多个人形智能体放到真值路线附近,同时人工检查路线没有被彻底封死,并增加 Human Collision Rate(HCR)指标。
训练数据通过规则化专家采集。当人形分割掩码超过阈值时,系统触发修改版 A* 重新规划避碰路线,最终在 60 个 Matterport3D 场景中生成 76.3 万条 social navigation episode。图中的行为包括等待空隙、侧向让行、绕过多人后恢复原指令路线。
图 4:DualVLN 在 Social-VLN 仿真与真实行人场景中的局部轨迹变化。来源:原论文 Figure 4。
但量化结果比演示视频更值得看:
| 模型 | 标准 R2R SR | Social-VLN SR | Social-VLN SPL | HCR |
|---|---|---|---|---|
| StreamVLN | 56.9 | 31.4 | 29.1 | 36.4 |
| DualVLN | 64.3 | 37.2 | 35.8 | 35.4 |
DualVLN 在任务成功率上仍优于 StreamVLN,但两者进入动态场景后都损失约 26—27 个百分点,碰撞率也只相差 1 个百分点。这说明高频局部规划提高了恢复能力,却还没有学会可靠的社交规范。Social-VLN 更准确的定位是“任务导向的动态人形避障基准”,而不是完整的人机共处测试。
5. Experiments:泛化、真机与消融
5.1 连续环境:单目 RGB 下刷新结果
在 VLN-CE 中,DualVLN 只使用第一视角单目 RGB,不依赖全景图、深度或里程计。关键结果如下:
| 模型 | R2R SR | R2R SPL | RxR SR | RxR SPL | RxR nDTW |
|---|---|---|---|---|---|
| NaVILA | 54.0 | 49.0 | 49.3 | 44.0 | 58.8 |
| StreamVLN | 56.9 | 51.9 | 52.9 | 46.0 | 61.9 |
| DualVLN | 64.3 | 58.5 | 61.4 | 51.8 | 70.0 |
在带物理运动控制器的 VLN-PE unseen split 上,DualVLN 没有使用 VLN-PE 轨迹微调,仍取得 51.60% SR 和 42.49% SPL;NaVid 分别为 22.42% 和 18.58%。不过 DualVLN 的平均轨迹更长,跌倒率和卡住率也高于 NaVid,说明高成功率并不等价于更稳定的底盘执行。
5.2 真机跨本体:结果很强,但不是完全板载 RGB-only
图 5:走廊、单卧室和 R2R 办公室中,每个模型、每个场景进行 20 次测试。来源:原论文 Figure 5 的 Success Rate 子图。
作者把同一模型部署到轮式 Turtlebot4、四足 Unitree Go2 和人形 Unitree G1。DualVLN 在走廊、单卧室和复杂办公室中的成功率分别为 100%、95% 和 70%;StreamVLN 分别为 100%、85% 和 60%。跨相机高度、震动和运动学本体保持了不错的零样本泛化。
这里必须区分“模型观测”与“整套机器人系统”。完整模型运行在远程 RTX 4090 上,占用约 20 GB 显存;机器人通过 RealSense D455 上传同步 RGB-D,服务器输出轨迹或视角动作,再借助里程计转换到世界坐标并由 MPC 跟踪。System 2 使用 KV cache 后,单次推理由 1.1 秒降到 0.7 秒;System 1 通过 TensorRT 在 0.03 秒内完成 32 点轨迹生成。
因此,论文证明的是高层模型可依靠 RGB 完成语义导航,以及双系统能接入多种机器人;它还没有证明整套系统能够仅凭单目视觉、完全板载地闭环运行。每个场景 20 次测试也足以观察趋势,但不足以覆盖真实公共空间的长尾风险。
5.3 消融:两个目标接口缺一不可
图 6:去掉顺序训练、像素目标上下文或可学习 latent goal 后,R2R Val-Unseen 的 SR、SPL、OS 和 NE 均退化。来源:原论文 Figure 7。
把两个系统改为单阶段联合训练,并取消显式中间像素目标,SR 从 64.3% 降到 55.2%,说明低层损失会拖慢扩散策略收敛,也会损害 VLM 的泛化。第二阶段移除像素目标文本后,SR 降到 62.2%;不用可学习查询、直接读取像素目标的固定 VLM 隐藏状态,SR 降到 60.9%。显式坐标和隐式语义并非重复信息。
作者还把 System 1 换成具有 oracle depth 的 point-goal planner。R2R unseen 上,iPlanner、NavDP 和 System 1 的 SR 分别为 47.07%、58.72% 和 63.62%。定性实验显示,System 1 可以容忍目标点落在障碍附近,只要大方向正确,视觉反馈就能让轨迹绕开障碍;但若像素目标方向或语义本身错了,它同样会失败。
6. Conclusion:双系统解决了频率矛盾,没有消除系统边界
DualVLN 给 VLN 提供了一条很务实的工程路线:让大 VLM 保留开放世界语义泛化,把它的输出压缩为显式像素目标与隐式语义目标,再让轻量策略负责高频、连续、动态的局部运动。它避免了用 7B 模型逐帧控制,也避免了传统模块化导航在语义规划与局部执行之间的信息断层。
论文仍留下四个清晰边界:
- 高层错误无法由低层完全补救。System 1 能修正小幅像素回归误差,但不能修正错误地标或错误方向。
- 动态避障尚未成为可靠的社会导航。35.4% HCR 和明显的成功率下降说明训练数据与评价指标仍需扩展。
- 真机系统依赖外部基础设施。远程 4090、RGB-D、里程计和 MPC 都属于实际部署成本。
- 2 Hz 与 30 Hz 是分层能力,不是端到端无延迟。System 2 的真实推理仍约 0.7 秒,异步机制主要是让机器人不必停下来等它。
猫先生认为,这篇论文对具身智能最有启发的结论是:通用模型未必需要直接成为实时控制器。未来更可扩展的基础模型,可能不是一个模型包办所有频率,而是让语义推理、局部策略和底层控制通过可学习、可解释且带时间信息的接口协同。DualVLN 已经把这条路线走通了一大步;下一步,则是让接口对高层幻觉更鲁棒,让局部策略真正理解人的意图,并把整套系统压进机器人本体。
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
