基于值分布强化学习的风险评估与保守策略学习研究综述.docVIP

  • 1
  • 0
  • 约5.02千字
  • 约 6页
  • 2026-09-30 发布于江苏
  • 举报

基于值分布强化学习的风险评估与保守策略学习研究综述.doc

基于值分布强化学习的风险评估与保守策略学习研究综述

一、值分布强化学习基础框架与风险表征逻辑

传统强化学习以期望回报作为优化目标,通过对状态-动作价值的期望估计引导策略迭代,本质上是对随机回报的一阶矩进行拟合,默认假设智能体对风险持中性态度。值分布强化学习(DistributionalReinforcementLearning,DRL)突破了这一假设,将价值估计从单点期望扩展为完整的概率分布,直接建模未来回报的随机特性,为风险评估与策略优化提供了更精细的信息维度。

Atari游戏场景下的经典实验表明,相同期望回报的两个动作,其回报分布的方差、偏度等高阶矩特征可能存在显著差异:动作A的回报集中在[80,120]区间,波动极小;动作B的回报则以0.5概率取得200、0.5概率取得0,二者期望均为100,但风险特征完全不同。传统DQN无法区分这类差异,而值分布强化学习通过建模回报的概率质量函数,能够完整捕捉不同动作的风险属性。目前主流的值分布建模方式主要分为三类:第一类是分位数回归方法,以IQN、QR-DQN为代表,通过估计回报分布的多个分位点来刻画分布形态,无需对分布形状做先验假设,鲁棒性较强;第二类是参数化分布建模,如C51算法将回报离散为51个固定支撑点,拟合每个支撑点的概率质量,GaussianDQN则假设回报服从正态分布,直接估计均值和方差;第三类是生成式分布建模,利用

文档评论(0)

1亿VIP精品文档

相关文档