- 1
- 0
- 约8.37千字
- 约 8页
- 2026-09-15 发布于上海
- 举报
强化学习工程师
一、单项选择题(共10题,每题1分,共10分)1.马尔可夫决策过程的核心性质是指下一个状态的概率分布仅由当前状态决定,与历史状态无关,该性质被称为A.平稳性B.马尔可夫性C.遍历性D.最优性答案:B解析:马尔可夫性的官方定义就是状态转移仅依赖当前状态,与过往历史无关。选项A平稳性指环境属性不随时间变化,选项C遍历性指智能体可到达所有状态,选项D最优性指智能体可收敛到最优策略,均不符合题干描述。2.贝尔曼期望方程用于定义以下哪类强化学习核心变量的迭代逻辑A.环境奖励信号B.状态/动作值函数C.策略梯度方差D.经验回放样本优先级答案:B解析:贝尔曼期望方程是值函数迭代求解的核心基础,通过当前状态的即时奖励加后续折扣值函数的期望推导值函数结果。其余选项对应的核心逻辑均不基于贝尔曼期望方程构建。3.多臂老虎机问题中ε-贪心策略的核心作用是A.完全消除探索行为,直接选择当前收益最高的摇臂B.以固定小概率随机选择摇臂,平衡探索与利用过程C.自动计算每个摇臂的置信上界,避免高估收益D.直接利用人类预设规则选择摇臂,减少计算量答案:B解析:ε-贪心的经典设计就是以ε的小概率随机探索所有摇臂,以1-ε的大概率选择当前观测收益最高的摇臂,平衡探索和利用的矛盾。选项A是纯贪心策略的行为,选项C属于UCB算法的特性,选
原创力文档

文档评论(0)