- 9
- 0
- 约5.88万字
- 约 39页
- 2023-06-06 发布于四川
- 举报
本公开涉及一种深度强化学习模型的训练方法、装置、介质及设备,所述方法包括:获取深度强化学习模型与虚拟环境交互所产生的交互序列,其中,交互序列包括多个采样数据,每一采样数据包括虚拟环境的第一状态、决策动作、以及在虚拟环境处于所述第一状态对应的状态下执行所述决策动作所得到的回报值和第二状态;针对每一所述采样数据,根据所述深度强化学习模型的优势函数和所述采样数据对应的决策策略,确定所述采样数据对应的计算动作价值;针对每一所述采样数据,根据所述采样数据对应的目标采样数据和所述目标采样数据对应的计算动作价
(19)中华人民共和国国家知识产权局
(12)发明专利申请
(10)申请公布号 CN 112766497 A
(43)申请公布日 2021.05.07
(21)申请号 202110127253.5
(22)申请日 2021.01.29
(71)申请人 北京字节跳动网络技术有限公司
您可能关注的文档
最近下载
- 2026年护士三基三严的试题及答案.docx VIP
- 调研报告标准格式及范文.docx VIP
- 学校宣传定做合同协议.docx VIP
- 2025年无人机驾驶员执照飞行疲劳管理公式应用专题试卷及解析.pdf VIP
- 第十届全国中小学体育优质课:高中跨栏跑技术教案.docx VIP
- 标准图集-99S203 消防水泵接合器安装.pdf VIP
- [安庆项目资料库]安庆市中心城区排水【雨水)防涝综合规划(2013-2030)·文本.pdf
- 2025年湘教版高一地理(人口老龄化)专题试卷及解析.docx VIP
- 2025年互联网营销师私域用户流失预警与挽留机制专题试卷及解析.pdf VIP
- 2025年人力资源管理师社交媒体在培训方法选择中的应用专题试卷及解析.pdf VIP
原创力文档

文档评论(0)