- 6
- 0
- 约7.64千字
- 约 54页
- 2019-09-30 发布于湖北
- 举报
优化方法-Nadam */25 可以看出,Nadam对学习率有了更强的约束,同时对梯度的更新也有更直接的影响; 一般而言,在想使用带动量的RMSprop,或者Adam的地方,大多可以使用Nadam取得更好的效果。 优化方法-Visualization of algorithms */25 优化方法-Visualization of algorithms */25 Adagrad, Adadelta, RMSprop, 和 Adam效果明显 优化方法-建议 */25 对于稀疏数据,尽量使用学习率可自适应的优化方法,不用手动调节,而且最好采用默认值; SGD通常训练时间更长,但是在好的初始化和学习率调度方案的情况下,结果更可靠; 如果在意更快的收敛,并且需要训练较深较复杂的网络时,推荐使用学习率自适应的优化方法; Adadelta,RMSprop,Adam是比较相近的算法,在相似的情况下表现差不多; 在想使用带动量的RMSprop,或者Adam的地方,大多可以使用Nadam取得更好的效果。 References: */25 [1] Sebastian Ruder. An overview of gradient descent optimization algorithms. eprint arXiv:1609.04747, 2016.9. [2]Quoc V. Le, Jiq
原创力文档

文档评论(0)