2026年秋江苏开放大学强化学习060733形考作业3答案.pdf

2026年秋江苏开放大学强化学习060733形考作业3答案.pdf

2026年秋江苏开放大学强化学习060733形考作业3答案

单选题

题型:单选题客观题分值5分难度:简单得分:5

1、确定性策略梯度算法(DPG)的核心思想是什么?

A、通过最大化当前状态的Q值来选择最优动作

B、通过最小化策略的损失函数来更新策略

C、直接通过策略梯度优化确定性策略的参数

D、通过生成随机动作来更新策略

学生答案:C

题型:单选题客观题分值5分难度:简单得分:5

2、以下说法是否正确:为了保证强化学习的训练效果,需要打破训练样本

数据之

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档