多臂老虎机中的遗憾界极限四则.docVIP

  • 0
  • 0
  • 约5.29千字
  • 约 6页
  • 2026-09-18 发布于江苏
  • 举报

多臂老虎机中的遗憾界极限四则

一、经典随机策略的遗憾界天花板:$\mathcal{O}(\sqrt{T})$

在多臂老虎机问题中,随机策略是最基础的探索与利用框架。这类策略的核心思想是通过在“探索未知臂”和“利用已知最优臂”之间分配随机概率,平衡长期收益与短期损失。其中,最具代表性的是ε-贪心算法:以$1-\varepsilon$的概率选择当前经验收益最高的臂,以$\varepsilon$的概率随机选择其他臂。理论分析表明,这类随机策略的遗憾界存在一个无法突破的天花板——$\mathcal{O}(\sqrt{T})$,其中$T$为总决策步数。

从数学推导来看,这一极限源于“探索次数的平方根律”。假设存在$K$个臂,其中最优臂与次优臂的期望收益差为$\Delta$(称为次优间隙),那么为了区分最优臂和次优臂,算法至少需要对每个次优臂进行$\mathcal{O}(1/\Delta^2)$次探索。当总步数$T$远大于这个探索次数时,总遗憾主要由前期探索次优臂的损失构成。根据Hoeffding不等式,误判最优臂的概率随探索次数增加呈指数下降,但探索次数本身需要与$\sqrt{T}$成正比才能保证在$T$步内将误判概率控制在常数范围内。因此,总遗憾的下界被证明为$\Omega(\sqrt{KT})$,而ε-贪心、UCB1等经典算法均能达到$\mathcal{O}(\sqrt{KT})$的上界

文档评论(0)

1亿VIP精品文档

相关文档