- 6
- 0
- 约1.34万字
- 约 11页
- 2023-06-25 发布于四川
- 举报
本发明公开了一种基于乐观投影的策略梯度多智能体强化学习方法,属于人工智能领域。本方法包含如下步骤:1、构建智能体初始策略网络;2、构建基于值分解的值函数评估网络;3、基于乐观投影对局部效用函数进行训练更新;4、使用整体Q值对值函数评估网络进行更新;5、使用评估网络指导策略网络更新;6、模型输出决策结果。本方法提出一种基于乐观投影思想的策略梯度多智能体强化学习方法,使用值分解方法构造策略梯度算法中的评论家网络,乐观评估智能体的动作值,从而加强策略搜索的合理性,鼓励探索最优策略,接着根据更加准确的值
(19)国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 116306898 A
(43)申请公布日 2023.06.23
(21)申请号 202310262004.6 G06N 3/044 (2023.01)
(22)申请日 2023.03.
原创力文档

文档评论(0)