AdaGrad中的累积梯度平方根倒数极限四则.docVIP

  • 1
  • 0
  • 约8.45千字
  • 约 11页
  • 2026-09-05 发布于江苏
  • 举报

AdaGrad中的累积梯度平方根倒数极限四则.doc

AdaGrad中的累积梯度平方根倒数极限四则

一、AdaGrad算法核心机制回顾

AdaGrad(AdaptiveGradientAlgorithm)是深度学习中经典的自适应学习率优化算法,由Duchi等人于2011年提出。其核心创新在于为每个参数维护一个累积梯度平方和,通过对学习率进行自适应调整,实现对不同参数的差异化更新。

在标准的梯度下降算法中,所有参数共享相同的学习率η,更新公式为:θ???=θ?-η·g?其中θ?表示t时刻的参数值,g?表示t时刻的梯度。

而AdaGrad的更新公式则为:θ???=θ?-(η/√(G?+ε))⊙g?这里G?是一个对角矩阵,其对角线上的元素G???是从初始时刻到t时刻第i个参数的梯度平方和,即G???=Σ?=0?g??2。ε是一个很小的常数,通常取1e-8,用于防止分母为零。⊙表示元素-wise的乘法。

从公式可以看出,AdaGrad的学习率是动态调整的。对于梯度较大的参数,其累积梯度平方和G???会快速增大,导致学习率η/√(G???+ε)减小,从而减缓该参数的更新速度;而对于梯度较小的参数,学习率则相对较大,能够更快地收敛。这种特性使得AdaGrad非常适合处理稀疏数据,因为在稀疏数据中,大部分参数的梯度在大部分时间都为零,只有少数参数会频繁更新。

二、累积梯度平方根倒数的数学定义与性质

(一

文档评论(0)

1亿VIP精品文档

相关文档