←
梯度下降编辑历史
提交《梯度下降》修改,状态:approved
查看这次修改
# 梯度下降 ## 1 基本概念 梯度下降是一种通过迭代更新参数来最小化(或最大化)可微函数的优化算法。它利用目标函数的梯度信息,引导搜索方向逐步逼近最优解。 ### 1.1 数学定义 梯度下降的数学基础建立在多元微积分之上,通过计算函数在参数空间中的变化率来指导搜索。 #### 1.1.1 梯度与方向导数 梯度是一个向量,其分量是目标函数对各参数的偏导数。方向导数则表示函数在某一方向上的变化率,梯度方向对应方向导数取得最大值的方向。 ##### 1.1.1.1 梯度的几何意义 在几何上,梯度指向函数值增长最快的方向,其模长表示该方向的变化速率。因此,负梯度方向即为函数值下降最快的方向。在等高线图中,梯度始终垂直于等高线,指向外侧(数值增加的方向)。 #### 1.1.2 迭代更新公式 梯度下降的核心迭代规则为:新参数值 = 旧参数值 - 学习率 × 梯度。数学表达为: θ_new = θ_old - η ∇J(θ_old) 其中θ表示参数向量,η是学习率,∇J(θ_old)是损失函数在θ_old处的梯度。 ##### 1.1.2.1 学习率的作用 学习率控制每次参数更新的步长。过大的学习率可能导致发散或震荡,过小的学习率则使收敛缓慢。合适的步长需要在探索速度与稳定性之间取得平衡,实践中常通过衰减策略或自适应方法进行调整。 ### 1.2 目标函数与损失函数 目标函数是待优化的函数,在机器学习中通常称为损失函数或代价函数,用于衡量模型预测与真实值之间的差异。常见的损失函数包括均方误差(回归问题)和交叉熵(分类问题)。梯度下降的目标是找到使损失函数最小化的参数。 ## 2 算法原理 根据每次更新时使用的数据样本数量,梯度下降可分为批量、随机和小批量三种主要形式。 ### 2.1 批量梯度下降 批量梯
Ciallo~(∠・ω< )⌒★