- 0
- 0
- 约2.69千字
- 约 20页
- 2026-08-10 发布于北京
- 举报
提纲OUTLINES
一、范式:基于多模态大模型的自动驾驶技术
二、世界模型驱动的一段式端到端解决方案可望获得突破
三、发展趋势:从感知智能到认知智能
提纲OUTLINES
一、范式:基于多模态大模型的自动驾驶技术
二、世界模型驱动的一段式端到端解决方案可望获得突破
三、发展趋势:从感知智能到认知智能
VLA融合了感知空间与动作空间,给出了两个空间与三大任务:
•两大空间:从感知或观察空间到动作空间,还是从动作空间到感知空间?
•两个空间之间的单段式或单模型相互作用;
•三个下游微调模型,即三大任务:具身理解、具身推理与具身动作生成大模型;
•基于上述三大微调模型,可优化训练的下游微调模型
空间决动间
本质上将VLM面向数字空间的理解与生
成推向了面向世界的理解与生成!
-性能增强的VLA:可望提升图像、、3D点云与语义地图等多模态数据的
语义对齐水平,从而获得更好的交叉理解;
-性能增强的VLA:也可望改善开放场景下的实例分割与目标检测准确率,实现
更好的视觉“分词”;
原创力文档

文档评论(0)