当前位置: 首页 > news >正文

不同传感器前中后融合方案简介

声明:本文主要参考开源资料进行学习整理,如有错漏,欢迎评论交流~

在自动驾驶场景下,摄像头 + 激光雷达的传感器融合方案是最常见的感知技术路线,目标是充分利用二者的互补性:

  • 摄像头优势:分辨率高、纹理丰富、颜色信息齐全,有利于识别语义信息(车道线、交通灯、行人类别等)。

  • 激光雷达优势:天然地具有深度信息,直接测得高精度距离和稠密点云,有利于构建 3D 几何结构和检测障碍物。

融合方式大致分为三类:前融合、中融合、后融合。

1. 前融合

前融合,是指把各个传感器的数据采集后,经过数据同步后,对这些原始数据进行融合,因此也称为数据级融合。将摄像头图像与激光雷达点云在几何空间对齐,例如把 3D LiDAR点云投影到2D图像上, 然后检查点云是否属于2D边界框。前融合展示如下图:

前融合可以从整体上来处理信息,让数据更早做融合,整体处理信息,让数据更有关联性,把激光雷达点云和摄像头像素级数据进行融合,信息损失比较少;但前融合也会存在一些问题,例如:点云数据和像素数据坐标系不同,直接融合效果差;需要处理的数据量大,对算力要求较高;对融合策略要求也比较高,目前业内应用的比较少。

2. 后融合

后融合是指摄像头和激光雷达等各传感器独立完成感知任务(如检测、分割),最后在结果层面进行融合(如加权,IOU匹配等),因此也称之为目标级融合。例如,可以将摄像头的2D边界框投影到3D边界框,然后将这些边界框与LiDAR检测过程中获得的边界框进行融合。

后融合的优点是传感器独立识别,解耦性好,易于扩展。缺点是会损失中间信息影响精度;rule-based 融合规则有局限性,难以充分利用跨模态互补信息。

后融合展示如下图:

3. 中融合

中融合,是指先将各个传感器通过神经网络模型提取中间层特征(即有效特征),再融合有效主要特征,也称为特征级融合,典型的是对有效特征在 BEV 空间进行融合。相比于前融合与后融合,在BEV空间进行中融合有如下优点:

  1. 跨摄像头融合和多模融合更容易实现,因为统一了数据空间,不需要处理规则关联不同传感器的感知结果,算法实现更加简单;

  2. 可以很容易地融合时序信息,形成4D空间,感知网络可以更好地实现一些感知任务,如测速等;

  3. 可“脑补”出被遮挡区域目标,在BEV空间,给予先验知识,对被遮挡的区域进行预测;

  4. 感知和预测在统一空间(BEV空间)内完成,可以通过神经网络直接做端到端优化,并行出结果,既可以避免误差累积,也可以减少人工逻辑,让感知网络通过数据驱动的方式自学习,从而更好地实现功能迭代。

目前使用最多的是中融合方案。

4. BEVFusion

BEVFusion是典型的中融合方法,将来自相机和LiDAR的原始输入编码到同一个BEV空间。如下图所示,BEVFusion主要由相机流、激光雷达流、动态融合模块和检测头组成,分别简单看下

相机流将多视角图像转到BEV空间,由图像编码器、视觉投影模块、BEV编码器组成。

图像编码器旨在将输入图像编码为语义信息丰富的深度特征,它由用于基本特征提取的2D backbone和用于多尺度特征提取的FPN组成,并采用了一个简单的功能自适应模块ADP来完善上采样功能,如下图所示:

视觉投影模块采用 LSS,将图像特征转换到自车坐标系的 3D 表示。该方法以图像视图为输入,通过离散分类的方式密集预测深度;随后结合相机外参与预测深度,生成伪体素表示。

BEV编码模块采用空间到通道(S2C)操作将4D伪体素特征编码到3D BEV空间,从而保留语义信息并降低成本。然后使用四个3 × 3卷积层缩小通道维度,并提取高级语义信息。

动态融合模块的作用是将concat后的 相机、 LiDAR的 BEV特 进行有效融合,BEVFusion应用一个简单的通道注意力模块来选择重要的融合特征,网络结构图如下所示:

LiDAR流将激光雷达点转换为BEV空间,BEVFusion采用3种流行的方法,PointPillars、CenterPoint和TransFusion 作为激光雷达流,从而展示模型框架的优秀泛化能力。

http://www.jsqmd.com/news/1392440/

相关文章:

  • 2026 年太原空调加氟空调出售,中央空调维修怎么预约? - LYL仔仔
  • Kettle数据迁移全复盘:从旧系统到新平台的8条实战经验清单
  • 手把手教你学 Simulink—— 整流器电磁干扰(EMI)滤波器设计与传导骚扰仿真
  • 【AI智能体速通】05.Agentic AI
  • Kimi LeetCode 3901. 好子序列查询 Python3实现
  • gcc编译器,以及源文件的翻译
  • 如何筛选靠谱的线上投票平台?2026年全场景通用投票工具深度评测
  • 从英语到斯瓦希里语,AI功能机的多语言适配怎么做?
  • POB汉化工具 PoeCharm 完整上手:3步安装与天赋技能配置实测
  • AI-实践 开发日志
  • 中国路况,中国速度——佳研 AI 让汽车碰撞仿真不再“卡脖子” - 2027品牌AI展
  • AI论文指令大合集:deepseek,kimi,豆包等各AI工具齐齐发力,轻松搞定论文写作难题
  • Databricks中用PySpark找到表里的最短唯一键
  • notepad-- 文件对比实战指南:3 步上手差异比对,5 个技巧让代码核查快 10 倍
  • TVA-具身智能最新进展(3):主动视觉感知提升实时性
  • 个体自发用 AI 提效已是职场常态,企业统一推进为何反而频频遇阻
  • 武汉江夏初中毕业生技术学校推荐 i3D AI 三维专业本地可参观试学 - 荆楚笔记
  • GHelper完整使用指南:如何用一个轻量小工具接管华硕笔记本性能控制
  • 合并报表系统有哪些?6家服务商能力对比与选型建议
  • Windows Defender 移除完整指南:三档移除深度与一次 ISO 实战演示
  • OpenBMC:WebUI 与后端接口交互流程
  • OneNote 笔记搬家到 Markdown:用 onenote-md-exporter 一劳永逸的完整教程
  • 【GitOps·入门篇】工具生态:ArgoCD、Flux、Jenkins X 对比选型
  • 2026年智慧步道建设指南:从硬件到运营的全链路解析
  • 聊天记录都在,模型为什么还是会“忘记”?
  • 基于 Java Web 的在线学习教育平台管理系统的设计与实现-----附源码85799-----课程、报名、考试与教学管理的一体化实现
  • TypeScript 灵魂拷问:type 和 interface 到底怎么选?
  • 闲置盒马卡别吃亏!2026年详解盒马卡回收一般几折 - 京顺回收
  • 山东本地综合实力强的职业院校推荐:选校时值得关注的几个维度 - 2027品牌AI展
  • 从一句主题到一支成片:Pixelle-Video 零门槛全自动短视频引擎