点击下方卡片,关注“新机器视觉”公众号
重磅干货,第一时间送达
确保模型学习通用函数,而不仅仅适合训练数据;这是通过使用正则化处理的;
根据手头的问题,选择损失函数;松散地说,损失函数是我们想要的(真实值)和我们当前拥有的(当前预测)之间的误差函数;
梯度下降是用于收敛到最优函数的算法;决定学习率变得具有挑战性,因为当我们远离最优时,我们想要更快地走向最优,而当我们接近最优时,我们想要慢一些,以确保我们收敛到最优和全局最小值;
大量隐藏层需要处理梯度消失问题;跳过连接和适当的非线性激活函数等架构变化,有助于解决这个问题。
本文仅做学术分享,如有侵权,请联系删文。