- 6
- 0
- 约1.95万字
- 约 17页
- 2023-05-10 发布于四川
- 举报
本发明公开一种基于最小二乘截断时域差分学习的路径规划决策优化方法,步骤包括:S1.使用第一策略收集智能体与环境交互样本,并学习特征表示的基函数;S2.评价器使用执行器生成的第二策略收集智能体与环境交互样本,利用基函数获得样本特征,并利用投影均方贝尔曼误差作为截断指标,以控制采用最小二乘时域差分或线性时域差分进行参数更新,获取近似最优的策略评价器;S3.使用执行器生成的策略收集与环境交互样本,并利用基函数获得样本特征,使用步骤S2中评价器作为策略执行器的评价函数,得到控制策略输出;S4.按照得到的
(19)国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 114518751 A
(43)申请公布日 2022.05.20
(21)申请号 202111682698.6
(22)申请日 2021.12.31
(71)申请人 中国人民解放军国防科技大学
地址
原创力文档

文档评论(0)