梯度下降

不断调整模型参数,让模型预测错误越来越小的优化方法。

把它讲透

梯度下降到底是什么?

不断调整模型参数,让“错误”越来越小的一种方法。

机器学习训练不是直接寻找正确答案,而是在寻找一组能让损失函数尽可能小的模型参数。梯度下降就是这组参数的更新方法。

先用下山理解

想象你站在大雾中的山上,目标是走到最低点。你看不到整座山,但能感觉到脚下哪里更陡、往哪边走会下降得更快。每走一小步,就重新判断一次方向;不断重复,最终会接近谷底。

核心过程:三步走

  1. 误差(损失)

    先用当前参数做预测,再与真实答案比较,得到损失。损失越小,说明模型错得越少。

  2. 梯度(方向)

    计算损失函数在当前位置的坡度。梯度指出“让误差增大最快”的方向,因此我们要往反方向走。

  3. 参数更新(迈出一步)

    按学习率控制步长,沿梯度的反方向移动参数;再重复上面两步,直到损失足够小。

用公式说清楚

不用被公式吓到,它只是把“看坡度,再走一小步”写成了数学语言。

w_new = w_old − η × ∂Loss/∂w

  • w — 模型参数

    模型中可以被调整的数值。

  • ∂Loss/∂w — 梯度

    参数改变一点后,损失会怎样变化。

  • η — 学习率

    每一步走多远;太大容易越过低点,太小则学习很慢。

神经网络训练时发生了什么?

大型神经网络会重复同一条链路数百万次:输入训练数据 → 做预测 → 计算 Loss → 反向传播计算每个参数的梯度 → 梯度下降更新参数 → 再预测。参数逐渐变好,模型的预测也随之改善。

容易误解

梯度下降是在寻找正确答案吗?

不是。它是在调整模型内部参数,使损失函数尽可能小;损失变小通常会带来更好的预测,但两者不是同一句话。

为什么还需要反向传播?

反向传播负责高效计算每个参数对 Loss 的影响;梯度下降负责拿到这些梯度后决定参数怎么改。

梯度下降就是:沿着让误差下降最快的方向,迈小步,不断调整参数,直到接近谷底。

它解决什么问题?

理解梯度下降,能帮助你在讨论 AI 方案时判断它解决的是哪一环,而不是只记住一个缩写。

它通常出现在哪?

在产品、技术或学习资料中看到“Gradient Descent”时,它通常出现在设计、训练或使用 AI 系统的语境里。