基于Transformer的自动驾驶场景鸟瞰图感知中的空间转换与特征对齐研究综述.docVIP

  • 0
  • 0
  • 约4.79千字
  • 约 5页
  • 2026-10-01 发布于江苏
  • 举报

基于Transformer的自动驾驶场景鸟瞰图感知中的空间转换与特征对齐研究综述.doc

基于Transformer的自动驾驶场景鸟瞰图感知中的空间转换与特征对齐研究综述

自动驾驶系统对周围环境的精准感知是决策规划与控制执行的核心前提,传统基于前视、环视等多相机的平面感知方案受限于透视投影带来的尺度畸变、遮挡问题,难以支撑复杂城市场景下3D空间关系的准确建模。鸟瞰图(BirdsEyeView,BEV)感知通过将多视角图像特征统一转换到俯视空间坐标系下,能够天然保留物体的真实尺寸、相对位置与道路拓扑关系,成为当前自动驾驶感知领域的主流技术路线。而Transformer架构凭借其全局注意力机制与长距离依赖建模能力,在BEV感知的空间转换、特征融合等核心环节展现出显著优势,相关研究在近五年呈现爆发式增长。

一、Transformer在BEV感知中的基础范式与技术演进

早期BEV感知方案多依赖于inverseperspectivemapping(IPM)等几何变换方法,假设地面为平面,直接将图像像素投影到BEV空间,该类方法计算高效但对平面假设偏差、相机外参扰动极为敏感,在坡度、颠簸场景下误差急剧上升。随着深度学习技术的发展,基于CNN的深度估计辅助投影方案逐渐成为主流,通过单目或双目深度预测网络为每个图像像素赋予3D空间坐标,再通过坐标变换将像素特征投影到BEV网格中,但这类方案受限于CNN的局部感受野,难以有效建模不同视角特征的全局空间关联,在远距离、遮挡区域的

文档评论(0)

1亿VIP精品文档

相关文档