深度学习及其优化方法.pptVIP

  • 6
  • 0
  • 约7.64千字
  • 约 54页
  • 2019-09-30 发布于湖北
  • 举报
优化方法-Nadam */25 可以看出,Nadam对学习率有了更强的约束,同时对梯度的更新也有更直接的影响; 一般而言,在想使用带动量的RMSprop,或者Adam的地方,大多可以使用Nadam取得更好的效果。 优化方法-Visualization of algorithms */25 优化方法-Visualization of algorithms */25 Adagrad, Adadelta, RMSprop, 和 Adam效果明显 优化方法-建议 */25 对于稀疏数据,尽量使用学习率可自适应的优化方法,不用手动调节,而且最好采用默认值; SGD通常训练时间更长,但是在好的初始化和学习率调度方案的情况下,结果更可靠; 如果在意更快的收敛,并且需要训练较深较复杂的网络时,推荐使用学习率自适应的优化方法; Adadelta,RMSprop,Adam是比较相近的算法,在相似的情况下表现差不多; 在想使用带动量的RMSprop,或者Adam的地方,大多可以使用Nadam取得更好的效果。 References: */25 [1] Sebastian Ruder. An overview of gradient descent optimization algorithms. eprint arXiv:1609.04747, 2016.9. [2]Quoc V. Le, Jiq

文档评论(0)

1亿VIP精品文档

相关文档