2025年AI推荐系统强化学习策略梯度优化建模考核试卷.docVIP

  • 1
  • 0
  • 约4.87千字
  • 约 13页
  • 2026-08-19 发布于天津
  • 举报

2025年AI推荐系统强化学习策略梯度优化建模考核试卷.doc

2025年AI推荐系统强化学习策略梯度优化建模考核试卷

一、单项选择题(每题1分,共30题)

1.在强化学习策略梯度优化中,以下哪个方法主要用于提高策略更新的稳定性?

A.Q-learning

B.SARSA

C.REINFORCE

D.Actor-Critic

2.策略梯度方法中,哪个术语指的是策略参数的更新方向?

A.ValueFunction

B.PolicyGradient

C.ActionValue

D.StateValue

3.在强化学习中,哪个算法使用价值函数来辅助策略更新?

A.PolicyGradient

B.Q-Learning

C.SARSA

D.Actor-Critic

文档评论(0)

1亿VIP精品文档

相关文档