- 2
- 0
- 约8.24千字
- 约 9页
- 2026-09-29 发布于江苏
- 举报
NAdam中的Nesterov加速项极限四则
一、Nesterov加速项的数学本质:从动量到极限的跃迁
在深度学习优化算法的演进中,动量(Momentum)策略的出现是一次关键突破。传统的随机梯度下降(SGD)仅依赖当前时刻的梯度更新参数,容易陷入局部最优或在鞍点附近震荡。动量算法通过引入历史梯度的加权平均,模拟物理中的“惯性”效应,使参数更新方向更稳定,加速收敛过程。其核心公式可表示为:
$$v_t=\betav_{t-1}+(1-\beta)g_t$$$$\theta_t=\theta_{t-1}-\alphav_t$$
其中,$v_t$是时刻$t$的动量项,$\beta$是动量衰减系数,$g_t$是当前梯度,$\alpha$是学习率,$\theta_t$是更新后的参数。
然而,标准动量算法存在一个明显缺陷:它仅利用历史梯度的累积来“推动”参数更新,却无法提前感知参数更新后的梯度变化。这就像一辆蒙着眼睛的汽车,只能根据过去的行驶方向调整速度,却看不到前方的路况。Nesterov加速梯度(NAG)正是为解决这一问题而生。NAG的核心思想是提前计算参数在动量方向上移动后的梯度,从而更精准地调整更新方向。其公式为:
$$v_t=\betav_{t-1}+(1-\beta)g_t(\theta_{t-1}-\alpha\betav_{
原创力文档

文档评论(0)