多智能体强化学习、策略执行方法及计算机设备.pdfVIP

  • 5
  • 0
  • 约2.65万字
  • 约 20页
  • 2023-05-10 发布于四川
  • 举报

多智能体强化学习、策略执行方法及计算机设备.pdf

本申请实施例公开了一种多智能体强化学习、策略执行方法及计算机设备。其中,方法包括:利用各智能体的内部状态以及环境状态建立多智能体决策模型;以各智能体的内部状态以及环境状态作为输入,并以智能体的行动策略作为输出,构建多智能体强化学习模型;基于预先设置的策略路径数量以及初始行动策略对多智能体强化学习模型进行训练,在训练过程中,按照多智能体决策模型确定智能体的下一行动策略,根据下一步行动策略执行动作得到下一环境状态和内部状态;直到环境状态或内部状态满足结束条件且迭代训练的次数达到策略路径数量,得到训练

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 114519433 A (43)申请公布日 2022.05.20 (21)申请号 202210149172.X (22)申请日 2022.02.18 (71)申请人 星环信息科技(上海)股份有限公司 地

文档评论(0)

1亿VIP精品文档

相关文档