- 390
- 0
- 约1.73千字
- 约 41页
- 2022-04-07 发布于四川
- 举报
深度学习之强化学习.pdf深度学习之强化学习.pdf
明天是打球还是学习呢?
+1 (奖励) -1 (惩罚)
(奖励) (惩罚)
学习系统没有像很多其它形式的机器学习方法一样被告知应该做出什么行为
必须在尝试了之后才能发现哪些行为会导致奖励的最大化
当前的行为可能不仅仅会影响即时奖励,还会影响下一步的奖励以及后续的所有奖励
智能体 (agent)
状态
您可能关注的文档
最近下载
- 中考现代文阅读——能能《秋天是一匹瘦马》.docx VIP
- 宁夏大学《高等数学Ⅱ》2025-----2026学年期末试卷(A卷).docx VIP
- 2026年惠州中考化学全程备考与高分突破指南.docx VIP
- 压力管道设计单位压力管道质量安全总监职责和压力管道质量安全员守则.docx VIP
- 护理专业临床带教技巧与方法.pptx VIP
- 艾玛迪斯机票预订-Amadeus.PDF
- (高清版)B-T 22793-2022 儿童高椅安全性能试验方法.pdf VIP
- 山下有松品牌2027双平台年度营销方案【社媒运营】【种草营销】.pptx VIP
- 【国盛-2026研报】AI光互联景气上行,重视陶瓷基板与管壳.pdf VIP
- 委托第三方医药物流储运审计表.doc VIP
原创力文档

文档评论(0)