RMSProp中的移动平均衰减极限四则.docVIP

  • 0
  • 0
  • 约6.69千字
  • 约 9页
  • 2026-09-04 发布于江苏
  • 举报

RMSProp中的移动平均衰减极限四则

一、移动平均衰减的数学本质:从指数加权平均到极限收敛

RMSProp算法的核心创新在于对梯度的平方项引入指数加权移动平均(ExponentiallyWeightedMovingAverage,EWMA),以此自适应调整学习率。移动平均衰减系数(通常记为$\gamma$)是这一机制的核心参数,其数学表达式为:$$E[g^2]t=\gammaE[g^2]{t-1}+(1-\gamma)g_t^2$$其中$E[g^2]_t$表示第$t$时刻梯度平方的移动平均值,$g_t$为当前时刻的梯度。从极限视角分析,当训练步数$t\to\infty$时,移动平均的收敛特性完全由$\gamma$决定。

(一)衰减系数的权重分配逻辑

$\gamma$的取值直接决定了历史梯度信息的保留比例:

当$\gamma\to1$时,$(1-\gamma)\to0$,移动平均几乎完全依赖历史值,当前梯度的权重趋近于0,此时$E[g^2]t\approxE[g^2]{t-1}$,平均值更新缓慢,具有极强的平滑性;

当$\gamma\to0$时,$(1-\gamma)\to1$,移动平均几乎完全由当前梯度主导,历史信息被快速遗忘,$E[g^2]_t\approxg_t^2$,平均值波动剧烈,平滑性丧失。

这种权重分配本质上是一种“指数

文档评论(0)

1亿VIP精品文档

相关文档