梯度下降
不断调整模型参数,让模型预测错误越来越小的优化方法。
把它讲透
梯度下降到底是什么?
不断调整模型参数,让“错误”越来越小的一种方法。
机器学习训练不是直接寻找正确答案,而是在寻找一组能让损失函数尽可能小的模型参数。梯度下降就是这组参数的更新方法。
先用下山理解
想象你站在大雾中的山上,目标是走到最低点。你看不到整座山,但能感觉到脚下哪里更陡、往哪边走会下降得更快。每走一小步,就重新判断一次方向;不断重复,最终会接近谷底。
核心过程:三步走
- 误差(损失)
先用当前参数做预测,再与真实答案比较,得到损失。损失越小,说明模型错得越少。
- 梯度(方向)
计算损失函数在当前位置的坡度。梯度指出“让误差增大最快”的方向,因此我们要往反方向走。
- 参数更新(迈出一步)
按学习率控制步长,沿梯度的反方向移动参数;再重复上面两步,直到损失足够小。
用公式说清楚
不用被公式吓到,它只是把“看坡度,再走一小步”写成了数学语言。
w_new = w_old − η × ∂Loss/∂w
- w — 模型参数
模型中可以被调整的数值。
- ∂Loss/∂w — 梯度
参数改变一点后,损失会怎样变化。
- η — 学习率
每一步走多远;太大容易越过低点,太小则学习很慢。
神经网络训练时发生了什么?
大型神经网络会重复同一条链路数百万次:输入训练数据 → 做预测 → 计算 Loss → 反向传播计算每个参数的梯度 → 梯度下降更新参数 → 再预测。参数逐渐变好,模型的预测也随之改善。
容易误解
梯度下降是在寻找正确答案吗?
不是。它是在调整模型内部参数,使损失函数尽可能小;损失变小通常会带来更好的预测,但两者不是同一句话。
为什么还需要反向传播?
反向传播负责高效计算每个参数对 Loss 的影响;梯度下降负责拿到这些梯度后决定参数怎么改。
梯度下降就是:沿着让误差下降最快的方向,迈小步,不断调整参数,直到接近谷底。
它解决什么问题?
理解梯度下降,能帮助你在讨论 AI 方案时判断它解决的是哪一环,而不是只记住一个缩写。
它通常出现在哪?
在产品、技术或学习资料中看到“Gradient Descent”时,它通常出现在设计、训练或使用 AI 系统的语境里。