

























在机器学习和统计建模中,我们常常需要找到一个模型的参数,使得 损失函数 (Loss Function) 最小。
比如线性回归的损失函数(均方误差 MSE):
\[J(\theta) = \frac{1}{2m} \sum_{i=1}^{m} (h_\theta(x^{(i)}) - y^{(i)})^2 \]
其中:
目标:
\[\min_\theta J(\theta) \]
在多元函数中,梯度(gradient) 是偏导数组成的向量:
\[\nabla J(\theta) = \left( \frac{\partial J}{\partial \theta_1}, \frac{\partial J}{\partial \theta_2}, \cdots, \frac{\partial J}{\partial \theta_n} \right) \]
直观理解:
所以,我们要最小化函数,就朝 负梯度 方向走。
基本更新规则:
\[\theta := \theta - \alpha \nabla J(\theta) \]
其中:
假设函数只有一个参数 \(\theta\),更新公式就是:
\[\theta := \theta - \alpha \frac{dJ}{d\theta} \]
这样逐步迭代,就会逼近函数的最小值。
批量梯度下降 (Batch GD)
每次使用所有样本来计算梯度。稳定但计算量大。
随机梯度下降 (SGD)
每次只用一个样本来更新参数。速度快,但震荡大。
小批量梯度下降 (Mini-batch GD)
每次使用一小批样本更新。结合了批量和随机的优点,是最常用的方法。
✅ 总结
梯度下降法的核心思想:
公式核心:
\[\theta := \theta - \alpha \nabla J(\theta) \]
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。