AMSGrad中的最大历史梯度极限四则.docVIP

  • 1
  • 0
  • 约5.92千字
  • 约 8页
  • 2026-09-07 发布于江苏
  • 举报

AMSGrad中的最大历史梯度极限四则

一、最大历史梯度极限的定义与数学表达

在深度学习优化算法的演进中,自适应矩估计(AdaptiveMomentEstimation,Adam)及其变体AMSGrad的核心创新之一,在于对梯度信息的动态追踪与利用。AMSGrad作为Adam的改进版本,针对Adam可能出现的收敛不稳定问题,引入了最大历史梯度极限(MaximumHistoricalGradientLimit)这一关键概念。

从数学层面看,最大历史梯度极限可以定义为:在模型训练的每一个时间步(t),对每个参数维度(i),维护一个变量(v_t^{(i)}),该变量记录了从训练开始到当前时间步(t)为止,所有梯度平方的指数移动平均值的最大值。其更新公式如下:

[v_t^{(i)}=\max\left(v_{t-1}^{(i)},\beta_2v_{t-1}^{(i)}+(1-\beta_2)(g_t^{(i)})^2\right)]

其中,(g_t^{(i)})表示第(t)步在参数(i)上的梯度值,(\beta_2)是一个介于0和1之间的指数衰减率超参数,通常设置为0.9或0.999。这一公式的核心在于,通过取最大值操作,确保(v_t^{(i)})始终是对历史梯度平方的“保守估计”,不会随着训练

文档评论(0)

1亿VIP精品文档

相关文档