- 1
- 0
- 约5.02千字
- 约 6页
- 2026-09-30 发布于江苏
- 举报
基于值分布强化学习的风险评估与保守策略学习研究综述
一、值分布强化学习基础框架与风险表征逻辑
传统强化学习以期望回报作为优化目标,通过对状态-动作价值的期望估计引导策略迭代,本质上是对随机回报的一阶矩进行拟合,默认假设智能体对风险持中性态度。值分布强化学习(DistributionalReinforcementLearning,DRL)突破了这一假设,将价值估计从单点期望扩展为完整的概率分布,直接建模未来回报的随机特性,为风险评估与策略优化提供了更精细的信息维度。
Atari游戏场景下的经典实验表明,相同期望回报的两个动作,其回报分布的方差、偏度等高阶矩特征可能存在显著差异:动作A的回报集中在[80,120]区间,波动极小;动作B的回报则以0.5概率取得200、0.5概率取得0,二者期望均为100,但风险特征完全不同。传统DQN无法区分这类差异,而值分布强化学习通过建模回报的概率质量函数,能够完整捕捉不同动作的风险属性。目前主流的值分布建模方式主要分为三类:第一类是分位数回归方法,以IQN、QR-DQN为代表,通过估计回报分布的多个分位点来刻画分布形态,无需对分布形状做先验假设,鲁棒性较强;第二类是参数化分布建模,如C51算法将回报离散为51个固定支撑点,拟合每个支撑点的概率质量,GaussianDQN则假设回报服从正态分布,直接估计均值和方差;第三类是生成式分布建模,利用
您可能关注的文档
最近下载
- 学堂课程在线大自然中的体育——山地户外运动(浙农)课后作业答案.docx
- 深度解析(2026)《GBT 3098.6-2023紧固件机械性能 不锈钢螺栓、螺钉和螺柱》.pptx VIP
- 新湘美版小学美术三年级上册第二单元3泥巴罐课件.ppt
- 初中地理_制作简易地球仪教学设计学情分析教材分析课后反思.pdf VIP
- 初中地理《制作简易地球仪》优质教案、教学设计.docx VIP
- 《反三角函数(正课)》-课件.ppt VIP
- (高清版)-B-T 3098.6-2023 紧固件机械性能 不锈钢螺栓、螺钉和螺柱.pdf VIP
- 《警察与赞美诗》(欧亨利)全文.docx VIP
- 武汉光迅科技股份有限公司2026届春季校园招聘笔试历年备考题库附带答案详解.docx VIP
- (正式版)DB51∕T 1464-2012 《杉木二元立木材积表、单木出材率表》.docx VIP
原创力文档

文档评论(0)