首页
学习
活动
专区
圈层
工具
发布
首页视频梯度下降慢?为何大模型不用牛顿法

梯度下降慢?为何大模型不用牛顿法原创

播放72
🤔面试官灵魂拷问:大模型训练为什么还用‘慢吞吞’的梯度下降,而不用收敛更快的牛顿法?今天把性能、稳定性、鞍点三个痛点讲透!牛顿法每次要算Hessian逆,10亿参数直接卡死,还容易在鞍点翻车。梯度下降虽慢但稳,还能靠SGD随手溜走。不过我们也没放弃二阶信息,Adam和L-BFGS都在偷偷用它。收藏下次面试用~你觉得未来会有更好的优化器吗? #深度学习 #机器学习 #面试技巧"
视频文本
展开

我来说两句

0 条评论
登录 后参与评论

作者

杨夕

相关推荐

3分32秒
最新自研Electron38+Vite7桌面版OS系统【体验版】
538
8分22秒
electron38+vue3+arco.design仿window桌面版os系统
539
4分43秒
自研electron38+vue3+arco.design客户端仿macOS界面os系统
539
8分7秒
vite7+electron38-wechat桌面客户端聊天exe应用【完整演示】
541
4分58秒
原创新作Vite7+Electron38.2+Arco电脑端os管理系统
541
10分29秒
最新原创Vue3.5+Electron38.2跨平台桌面版os后台系统【源码演示版】
542
领券