2026年人工智能考研真题及强化学习.docx

2026年人工智能考研真题及强化学习.docx

PAGE/NUMPAGES

2026年人工智能考研真题及强化学习

考试时间:______分钟总分:______分姓名:______

一、选择题(每小题2分,共20分。下列每小题给出的四个选项中,只有一项是符合题目要求的。请将正确选项前的字母填在答题卡相应位置。)

1.在马尔可夫决策过程中,贝尔曼方程V(s)=Σ_aΣ_p(r|s,a,s)[r+γV(s)](a)表示的是:

A.策略评估方程,评估使用策略π时的价值函数

B.策略改进方程,用于更新策略π

C.Q-Learning算法的更新规则

D.SARSA算法的更

文档评论(0)

1亿VIP精品文档

相关文档