AI系列深度25期:从模仿学习到强化学习的范式跃迁.docxVIP

  • 0
  • 0
  • 约1.11万字
  • 约 17页
  • 2026-08-11 发布于湖南
  • 举报

AI系列深度25期:从模仿学习到强化学习的范式跃迁.docx

东吴证券研究所1/13

东吴证券研究所

请务必阅读正文之后的免责声明部分

请务必阅读正文之后的免责声明部分

证券研究报告

证券研究报告·行业深度报告·汽车

汽车行业深度报告

汽车行业深度报告

AI系列深度25期:从模仿学习到强化学习的范式跃迁

2026年08月07日

增持(维持)

投资要点

n模仿学习的能力上限在数字AI与物理AI之间存在结构性分野。大语言模型预训练本质上是对互联网级人类知识的规模化模仿,学习对象覆盖公开语料中的多领域知识,广度上限高于单一专家,因此可形成较高能力底座;自动驾驶端到端模型主要学习人类驾驶轨迹,而L4安全目标要求显著超越平均人类表现,模仿学习天花板约束更强。

n闭环驾驶会放大模仿学习的结构性缺陷。行为克隆在训练分布内表现稳定,但一旦进入示范数据未覆盖状态,模型输出偏差会推动车辆进入新的状态分布,形成协变量漂移;长尾、危险和事故场景也难以依靠真实道路主动采集。强化学习因而不只是后训练补强,而是驾驶模型突破模仿边界的重要环节。

n强化学习与世界模型在物理AI中形成双向共生。真实道路无法承担反复试错、失败重置和危险事件注入,世界模型因此成为策略训练、奖励设计与安全验证的闭环试错场;同时,真实数据回流与策略训练也会暴露仿真偏差,推动世界模型持续校准。

n产业实践正在向“端到端+世界模型仿真+强化学习

文档评论(0)

1亿VIP精品文档

相关文档