2026年计算机专业考博《人工智能导论》押题卷及答案解析
一、简答题(每题8分,共40分)
1.简述马尔可夫决策过程(MDP)中的贝尔曼最优性方程,并说明其在强化学习中的核心作用。
答案:贝尔曼最优性方程描述了最优状态值函数V*(s)或最优动作值函数
2.对比监督学习与强化学习在反馈机制与数据分布上的核心差异。
答案:(1)反馈机制:监督学习具有延迟的静态标签反馈,每条数据均有明确的正确答案;强化学习具有延迟的动态奖励反馈,反馈通常具有时间滞后性且非二值化。
(2)数据分布:监督学习基于独立同分布(i.i.d.)的静态数据集;强化学习的数据由智能体与环境交互动态生成,具有
您可能关注的文档
最近下载
- 旋转蒸发仪设备确认方案.pdf VIP
- CSCO胰腺癌诊疗指南(2026版).docx VIP
- 地球和地球仪课件中图版地理七年级上册.pptx VIP
- 2.1地球和地球仪课件-2025-2026学年地理中图版七年级上册.pptx VIP
- 14D504 接地装置安装.docx VIP
- 2.2+地球运动(第2课时+公转)(教学课件)-七年级地理上册同步教学系列(新教材湘教版).pptx VIP
- 火针疗法(113)(优质课件).pptx VIP
- 2026csco胰腺癌诊疗指南.docx VIP
- 2.2+地球运动(第1课时+自转)(教学课件)-七年级地理上册同步教学系列(新教材湘教版).pptx VIP
- 2.1+地球与地球仪(第1课时)课件+-2025-2026学年地理湘教版七年级上册.pptx VIP
原创力文档

文档评论(0)