人工智能通识导论(理工类) 课件 第7章 强化学习.pptx

人工智能通识导论(理工类) 课件 第7章 强化学习.pptx

;目录;强化学习;第7章强化学习:主要内容;本章导入:从AlphaGo到大模型对齐;一个迷宫游戏示例;强化学习的核心要素;智能体(Agent);策略(Policy);确定性策略与随机性策略;行动与环境;状态与状态空间;状态转移;用概率描述状态转移;奖励(Reward);稀疏奖励与密集奖励;小结:在交互循环中不断“强化”;马尔可夫性质;状态设计决定马尔可夫性质;马尔可夫过程;示例:学生上课状态转移;马尔可夫决策过程(MDP);MDP建模示例;回报与折扣因子;回报是随机变量;状态价值函数Vπ(s);示例:1×3网格中的状态价值;动作价值函数Qπ

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档