- 1
- 0
- 约1.09万字
- 约 10页
- 2026-08-12 发布于湖南
- 举报
增持(维持)
投资要点
n智能驾驶VLA的核心,是将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合VLM4AD留下的动作生成缺口。
从技术演进看,自动驾驶经历模块化流水线、端到端、VLM4AD再到VLA4AD:VLM能解释场景但难以直接生成可靠控制,VLA则进一步把动作作为模型输出,使语义理解与驾驶策略更紧密耦合。
nVLA4AD的核心架构通常包括视觉编码器、语言处理器和动作解码器三部分。视觉编码器将摄像头、激光雷达等异构传感输入转化为隐层特征,并通过BEV、点云、体素等方式增强三维空间理解;语言处理器引入预训练大模型、LoRA或RAG
原创力文档

文档评论(0)