基于多智能体离线强化学习的轨迹规划算法研究.pdfVIP

  • 2
  • 0
  • 约16.88万字
  • 约 89页
  • 2026-04-11 发布于广东
  • 举报

基于多智能体离线强化学习的轨迹规划算法研究.pdf

摘要

在多智能体轨迹规划领域,分布偏移问题严重制约了离线强化学习算法性能,现有基

于保守性约束的传统范式虽能保证算法稳定性,但显著降低了探索效率,而条件生成模型

方法在处理长程依赖关系时存在计算瓶颈。随着人工智能向多智能体协同决策的深度拓展,

高效安全的轨迹规划已成为智能交通、机器人集群等关键应用的核心技术支撑,分布偏移

问题的解决对推动多智能体系统产业化应用具有重要意义。针对上述问题,本文从轨迹策

略探索视角出发,提出安全保守性约束框架,量化了探索机制对行为原语多样性的增益效

果,实现了保守性和探索性的平衡;其次构建层次化行为原语表达体系,通过行为原语提

取轨迹规划准确评估策略价值,主要研究内容如下:

1

()在约束型框架之内,过度保守的策略往往限制了系统性能的发挥,本研究创新性

地开发出探索引导型离线强化学习算法CORE),该算法融合了定向探索策略,创新性地

运用保守性约束框架。具体而言,首先开展了基于扩散模型的状态分布建模,并将其与保

守值函数估计进行深度整合,进而精确地生成具有高价值的目标状态;其次构建了基于扩

散动力学的轨迹生成模型,借

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档