AI系列深度26期:云端基座模型如何在毫秒级车端跑起来.docxVIP

  • 0
  • 0
  • 约9.8千字
  • 约 14页
  • 2026-08-11 发布于湖南
  • 举报

AI系列深度26期:云端基座模型如何在毫秒级车端跑起来.docx

东吴证券研究所1/11

东吴证券研究所

请务必阅读正文之后的免责声明部分

请务必阅读正文之后的免责声明部分

证券研究报告

证券研究报告·行业深度报告·汽车

汽车行业深度报告

汽车行业深度报告

AI系列深度26期:云端基座模型如何在毫秒级车端跑起来

2026年08月07日

增持(维持)

投资要点

n学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。

n车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIAAlpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。

n云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉To

文档评论(0)

1亿VIP精品文档

相关文档