2026年秋江苏开放大学强化学习060733形考作业3答案.docx

2026年秋江苏开放大学强化学习060733形考作业3答案.docx

2026年秋江苏开放大学强化学习060733形考作业3答案

单选题

题型:单选题客观题分值5分难度:简单得分:5

1、确定性策略梯度算法(DPG)的核心思想是什么?

A、通过最大化当前状态的Q值来选择最优动作

B、通过最小化策略的损失函数来更新策略

C、直接通过策略梯度优化确定性策略的参数

D、通过生成随机动作来更新策略

学生答案:C

题型:单选题客观题分值5分难度:简单得分:5

2、以下说法是否正确:为了保证强化学习的训练效果,需要打破训练样本数据之间的相关性。

A、正确

B、错误

学生答案:A

题型:单选题客观题分值5分难度:简单得分:5

3、DQN中用到的技巧有()。

A、目标网络、利用

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档