LossFunction一般形式及数学概念深度学习梯度优化方法深度学习优化.pptVIP

  • 15
  • 0
  • 约7.61千字
  • 约 54页
  • 2018-12-06 发布于天津
  • 举报

LossFunction一般形式及数学概念深度学习梯度优化方法深度学习优化.ppt

LossFunction一般形式及数学概念深度学习梯度优化方法深度学习优化.ppt

优化方法 */25 5、 Mini-batch Gradient Descent 面临的挑战: learning rate选取比较困难 对于稀疏数据或者特征,有时我们可能想更新快一些; 对于常出现的特征更新慢一些,这时候SGD就不太能满足要求了; SGD容易收敛到局部最优,并且在某些情况下可能被困在鞍点 优化方法-Momentum */25 momentum是模拟物理里动量的概念,积累之前的动量来替代真正的梯度: 其中, 是动量因子。 优化方法-Momentum */25 SGD without momentum SGD with momentum 优化方法-Momentum */25 特点: 下降初期时,使用上一次参数更新,下降方向一致,乘上较大的 能够进行很好的加速; 下降中后期时,在局部最小值来回震荡的时候, , 使得更新幅度增大,跳出陷阱; 在梯度改变方向的时候, 能够减少更新; 总之,momentum项能够在相关方向加速SGD,抑制振荡,从而加快收敛。 优化方法-Nesterov */25 nesterov项在梯度更新时做一个校正,避免前进太快,同时提高灵敏度: 并没有直接改变当前梯度 ,所以Nesterov的改进就是让之前的动量直接影响当前的梯度。即: 因此,加上nesterov项后,梯

文档评论(0)

1亿VIP精品文档

相关文档