基于成本敏感的强化学习决策研究综述.docVIP

  • 1
  • 0
  • 约6.14千字
  • 约 7页
  • 2026-10-01 发布于江苏
  • 举报

基于成本敏感的强化学习决策研究综述.doc

基于成本敏感的强化学习决策研究综述

一、成本敏感强化学习的核心内涵与基础框架

成本敏感强化学习(Cost-SensitiveReinforcementLearning,CSRL)是经典强化学习在多目标约束场景下的重要延伸,其核心特征是将决策过程中产生的各类显性与隐性成本纳入价值函数优化目标,突破了传统强化学习仅以累积奖励最大化为唯一目标的局限性。在经典马尔可夫决策过程(MDP)框架中,智能体的决策目标是最大化长期奖励累积,即求解最优策略$\pi^*$使得$V^\pi(s)=\mathbb{E}{\tau\sim\pi}[\sum{t=0}^\infty\gamma^tr(s_t,a_t)]$最大,其中$\gamma$为折扣因子,$r(s_t,a_t)$为状态$s_t$下执行动作$a_t$获得的即时奖励。而成本敏感强化学习对该框架进行了扩展,引入成本向量$c(s_t,a_t)\in\mathbb{R}^k$表示决策产生的$k$类成本(如能源消耗、安全风险、隐私泄露代价等),优化目标转变为在约束累积成本不超过阈值的前提下最大化奖励,或寻找奖励与成本的帕累托最优平衡点。

根据成本约束的表现形式,CSRL可分为硬约束与软约束两大类别。硬约束CSRL要求智能体在整个决策过程中累计成本严格低于预设阈值,典型代表为约束马尔可夫决策过程(CMDP),其优化目标可表述为$\ma

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档