AI系列深度09期:从LLM到VLM再到VLA意味着什么?.docxVIP

  • 2
  • 0
  • 约1.07万字
  • 约 16页
  • 2026-08-03 发布于湖南
  • 举报

AI系列深度09期:从LLM到VLM再到VLA意味着什么?.docx

东吴证券研究所1/11

东吴证券研究所

请务必阅读正文之后的免责声明部分

请务必阅读正文之后的免责声明部分

证券研究报告

证券研究报告·行业深度报告·汽车

汽车行业深度报告

汽车行业深度报告

AI系列深度09期:从LLM到VLM再到VLA意味着什么?

2026年07月31日

增持(维持)

投资要点

nLLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM以文本为输入输出,主要解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next-token机制。

n从概念脉络看,LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、视觉编码器和模态投影,把视觉信息接入语言模型;VLA由GoogleDeepMind在RT-2中明确命名,核心是把视觉、语言与动作统一到策略模型中。

n从数据和表征看,三者难度逐级抬升。LLM训练依赖文本语料,VLM增加图文对和视觉编码,VLA则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据

文档评论(0)

1亿VIP精品文档

相关文档