清华MARS Lab:首个无距离上限几何Transformer SLAM,17公里长序列稳定建图
「PGGO联合优化位姿与稠密几何」
目录
01 内存条件坐标+PGGO双核心架构拆解
1.1 内存条件动态坐标系:破除首帧锚定尺度枷锁
1.2 PGGO位姿-几何联合优化:后端统一迭代修正
1.3 四模式分阶段训练,适配长短场景推理
02 三类长序列SLAM性能分层
03 数据集定量实验
3.1 户外KITTI、Waymo长序列测试
3.2 室内Replica、7-Scenes、TUM RGB-D基准
4.3 PGGO消融实验
04 写在最后
当下基于几何Transformer的稠密SLAM普遍存在致命规模瓶颈:不管是VGGT系列还是初代SLAM-Former,都存在固定坐标绑定、长序列误差持续累积的硬伤。
VGGT-Long采用子地图拼接思路,仅单独对齐相机位姿,局部几何结构完全不参与联合优化,长距离路段会出现点云撕裂、地图坍塌;初代SLAM-Former依赖首帧全局坐标系,序列越长KV缓存膨胀越严重,泛化能力完全被训练集轨迹尺度限制,千米级道路重建极易出现全局错位。
清华大学赵行教授团队(MARS Lab)推出SLAMFormer-∞,业内首款真正无距离上限的几何Transformer SLAM。
它放弃传统首帧锚定建模,引入内存条件动态坐标系,前端维持轻量化局部增量跟踪,后端新增位姿-几何图联合优化(PGGO)模块,实现任意超长轨迹位姿、稠密点云同步迭代修正。
实测可稳定完成17公里城市连续建图,在KITTI、Waymo户外数据集与Replica、7-Scenes室内基准上轨迹误差、重建精度全面领先同类型Transformer方案,解决长序列地图坍塌、局部几何失真两大工程痛点。
01 内存条件坐标+PGGO双核心架构拆解
整套系统分为条件式增量前端、迭代全局后端两大模块,核心创新为内存条件动态坐标系、位姿几何图优化PGGO,搭配四种适配长短场景的训练模式,兼顾实时跟踪与大规模全局重建。
1.1 内存条件动态坐标系:破除首帧锚定尺度枷锁
传统SLAM Transformer把全部帧绑定在第一帧固定世界坐标,SLAMFormer-∞彻底重构建模公式,引入内存锚定上下文作为局部参考基准,不再依赖全局固定原点。
简化建模公式解读:
传统SLAM-Former建模:,全部图像共用单一全局坐标系;
SLAMFormer-∞建模:,每一段窗口以历史内存锚作为局部坐标基准。
前端、后端均在局部条件坐标系完成推理,仅通过内存锚传递全局几何约束。推理时选取相邻关键帧窗口作为条件块,Transformer注意力仅限定在局部窗口内,不会加载全序列图像Token,从根源控制显存占用。窗口可动态滑动扩容,理论上不存在轨迹长度上限,17公里超长序列仅分段加载局部上下文即可稳定运行。
图| SLAMFormer-∞完整流水线示意图
前端推理公式仅加载当前帧+邻近历史窗口+内存锚条件,增量跟踪全程因果计算,保障单帧实时性;后端公式读取多段相邻条件块,执行跨窗口全局迭代优化。内存锚会持续更新存储优化后的位姿、点云Token,作为下一段窗口的参考基准,实现长距离信息无损传递。
1.2 PGGO位姿-几何联合优化:后端统一迭代修正
过往方案后端只优化相机位姿,稠密点云固定不变,几何误差无法消除。SLAMFormer-∞提出PGGO图优化框架,构建混合图(G=(V,E)),节点同时包含相机位姿X与三维几何P,边分为位姿约束边、几何注意力关联边两类。
核心优化目标简化公式:
代表第 n 帧位姿+几何联合状态,通过 Transformer 推理输出预测值与初始值做残差最小化。迭代流程分为两步:
1. 利用 Transformer 前向传播更新联合状态预测;
2. 阻尼加权更新位姿、直接替换点云,避免迭代震荡:
α为阻尼系数,平滑每一轮位姿更新幅度,防止迭代过程轨迹跳变。消融实验可见,关闭PGGO精细迭代模块后,Replica室内场景ATE RMSE从0.052m上涨至0.061,曲面噪点、模型断层显著增多;室外长序列提升幅度更大,KITTI长路段几何错位问题基本消除。
1.3 四模式分阶段训练,适配长短场景推理
为匹配前端实时跟踪、后端全局精修两种推理逻辑,论文设计四种共享权重的训练模式,仅调整注意力掩码与条件锚注入逻辑,一套权重同时适配室内短轨迹、室外超长道路场景。
图| SLAMFormer-∞四种训练模式示意图
- 模式1(前端训练):因果注意力,前两帧初始化局部坐标,后续帧仅读取历史KV缓存,模拟在线增量跟踪;
- 模式2(基础后端):混合注意力,无内存条件,适配中等长度序列全局粗优化;
- 模式3(带内存条件后端):注入历史锚定块,模拟长路段分段优化逻辑;
- 模式4(多条件精细后端):前后双向条件块约束,对应PGGO多轮迭代精修流程。
室内、室外采用两套训练配置:室内12帧裁剪、长边518;室外36帧、长边224,分别适配狭小室内高旋转、开阔道路长平移运动,48张A100完成10轮训练即可收敛。
02 三类长序列SLAM性能分层
当前长时序单目稠密重建赛道分为三类技术路线,从长序列稳定性、几何联合优化、显存开销、超长泛化四个维度横向对比,客观看待SLAMFormer-∞的优势与边界。
1. 子地图拼接类(VGGT-Long、VGGT-SLAM)
优势:单段子图推理压力小,易部署;短板仅优化位姿、几何不修正,长距离地图坍塌风险高,17公里测试直接失效,KITTI平均ATE 26.358m。
2. 初代单全局Transformer(SLAM-Former)
优势:位姿、几何同步建模,室内精度顶尖;短板固定全局坐标系,超长轨迹泛化崩盘,显存随序列长度爆炸,无法处理数公里车载场景。
3. SLAMFormer-∞
独有竞争力:内存动态坐标解除轨迹长度限制,PGGO实现位姿几何双向迭代修正,分段局部注意力控制显存,17公里城市连续建图无坍塌,KITTI平均ATE降至23.011m,Waymo数据集平均误差1.813m,同赛道最优。
图| KITTI多序列重建定性对比图
03 数据集定量实验
实验分为户外大规模道路、室内小型场景、PGGO消融三组,指标只解读工程实际意义,不单纯堆砌SOTA标签。
3.1 户外KITTI、Waymo长序列测试
图| KITTI里程数据集跟踪结果表
KITTI全部序列平均ATE:VGGT-Long 26.358m,SLAMFormer-∞ 23.011m,剔除高速01序列后平均误差低至15.653m;08、09等长路段提升幅度最明显,这类道路连续数千米无强回环,传统方案漂移持续累积。
图| Waymo城市分段跟踪结果表
Waymo多速度、多车流分段平均RMSE从VGGT-Long 1.996m降至1.813m,低速小区、高速主干道、拥堵路段全部稳定领先。指标局限:数据集道路环境规整,无极端陡坡、连续隧道场景,真实山区、地下长隧道误差涨幅会变大。
定性效果看,VGGT-Long重建道路边线、建筑轮廓扭曲,SLAMFormer-∞经过PGGO联合优化,路面、墙体曲面连续无分层,长距离地图不会出现撕裂断层。
3.2 室内Replica、7-Scenes、TUM RGB-D基准
图| 室内场景跟踪重建结果表
室内场景轨迹短,不存在超长尺度问题,初代SLAM-Former依靠全局全注意力精度小幅领先;SLAMFormer-∞关闭PGGO精细迭代后误差上升,说明迭代优化对短场景增益有限,但在7-Scenes真实室内场景仍优于VGGT-SLAM,ATE从0.068m降至0.046m。
落地提示:该架构核心优势是公里级超长户外场景,室内小规模重建有更轻量化替代方案,优先用于自动驾驶、低空巡检长时序建图场景。
4.3 PGGO消融实验
有无精细迭代模块对比:Replica数据集,带PGGO ATE 0.052m,移除后0.061m;重建精度、完整性、倒角距离同步变差。
图| PGGO精细阶段室内重建对比图
直观体现:未迭代模型墙面、桌面存在大量噪点凸起,迭代后曲面平滑,物体边缘轮廓清晰,证明位姿、几何同步迭代能修复局部微小畸变。
04 写在最后
几何Transformer SLAM此前长期困在“短序列高精度、长序列易崩塌”的二元矛盾中,SLAMFormer-∞通过内存条件动态坐标系打破首帧锚定的尺度束缚,搭配PGGO位姿-几何联合迭代优化,补齐了长时序场景几何校正的缺失环节。
从17公里城市自建数据集的实测结果来看,它首次让单目稠密Transformer真正具备无限长轨迹重建能力,为自动驾驶、低空巡检大范围三维地图自动化生成提供了全新单目技术路线。
但这套方案主打离线大规模建图,实时车载定位、多传感器融合仍有优化空间,后续叠加视觉-激光融合、轻量化回环模块,会进一步拓宽落地边界。
Ref
论文标题:SLAMFormer-∞: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing
论文链接:https://arxiv.org/pdf/2608.03429
项目地址:https://tsinghua-mars-lab.github.io/SLAMFormer-Infinity
