- 1
- 0
- 约6.03千字
- 约 7页
- 2026-10-01 发布于江苏
- 举报
基于Transformer的自动驾驶多模态感知中的激光雷达-相机特征融合与时间融合策略研究综述
多模态感知作为自动驾驶系统的核心环节,其性能直接决定了车辆对复杂交通场景的理解能力与决策准确性。传统基于卷积神经网络(CNN)的感知方法在处理局部特征提取任务中表现优异,但在长距离依赖建模、跨模态语义对齐等场景中存在固有局限性。Transformer架构凭借自注意力机制对全局关联关系的强大建模能力,近年来逐渐成为自动驾驶多模态感知领域的主流技术路径。其中激光雷达与相机的特征融合方案,以及跨帧时间维度的信息融合策略,是当前Transformer感知框架落地过程中的核心研究方向,相关技术突破对提升自动驾驶系统在复杂天气、动态遮挡等极端场景下的鲁棒性具有关键意义。
一、激光雷达-相机特征融合的Transformer架构演进
1.1早期融合(输入级融合)范式
早期融合方案的核心思路是在数据输入阶段完成激光雷达点云与相机图像的空间对齐,直接将多模态原始数据输入Transformer编码器进行特征提取。此类方案的典型代表是2021年提出的TransFusion架构,其首次将Transformer的交叉注意力机制引入多模态融合任务,通过点云查询向量同时捕捉激光雷达的3D几何信息与相机的2D纹理语义。该架构首先将激光雷达点云体素化后转换为初始查询序列,随后将图像特征作为上下文输入交叉注意力层,使每个点
原创力文档

文档评论(0)