1 基本概念
1.1 一元函数的驻点
1.1.1 定义:一阶导数为零
对实值函数 \(f(x)\),若在某点 \(x_0\) 处导数存在且满足 \[ f'(x_0)=0, \] 则称该点 \(x_0\) 为驻点(stationary point)。直观上,它对应“函数局部变化率为零”,也就是曲线在该点附近不呈现一阶的水平倾斜趋势。
1.1.2 与临界点的关系(stationary/critical)
在许多教材中,临界点(critical point)常被更宽泛地使用:它通常指导数为零或导数不存在的点。于是:
- 所有驻点都属于临界点;
- 反之未必成立,导数不存在的“尖点、拐点但无导数”的位置也可能是临界点,但不一定是驻点。
因此,“驻点”强调导数存在且为零,而“临界点”强调满足某种“临界条件”(零导数或不可导)。
1.2 多元函数的驻点
1.2.1 定义:梯度为零
对多元实值函数 \(f:\mathbb{R}^n\to \mathbb{R}\),若 \(f\) 在点 \(x_0\) 处可微并且梯度为零: \[ \nabla f(x_0)=0, \] 则称 \(x_0\) 为驻点。梯度刻画方向变化率,梯度为零表示在所有方向上的一阶变化都消失。
1.2.2 Hessian 矩阵与驻点分类
驻点是否对应局部极值,需要进一步信息。二阶导数信息通常由 Hessian 矩阵 \[ H_f(x_0)=\nabla^2 f(x_0) \] 提供。若 Hessian 在驻点处可用,则可通过其符号性质对驻点类型进行分类(例如极小、极大或鞍点倾向)。需要强调的是:二阶信息只能在一定光滑性与判别条件下给出可靠结论。
1.3 函数不光滑情形
1.3.1 广义导数与亚梯度直观
当函数不可导时,“梯度为零”的说法不再直接适用。为处理凸或一般不光滑函数,常用广义概念替代导数,如亚梯度(subgradient)。在凸分析语境中,若存在某个“广义斜率”集合,使得在 \(x_0\) 处可形成与零向量相兼容的条件,则 \(x_0\) 可被视为不光滑意义下的临界/驻点候选。直观上,函数在这些点附近的“最优下降方向”不存在。
1.3.2 次可微情形下的“驻点”讨论
更一般地,不光滑分析会引入更细致的工具描述局部行为,例如次可微、广义 Hessian 或切锥结构等。此时“驻点”通常被理解为:在某种广义一阶近似意义下,局部没有一阶改进空间。它并不总等同于可导情形的二阶判别,但作为优化与变分中的必要起点仍然重要。
2 判别与性质
2.1 二阶导数判别(本征分类)
2.1.1 二阶导数符号
对一元函数,驻点 \(x_0\) 满足 \(f'(x_0)=0\)。若再进一步有 \(f''(x_0)\neq 0\),则常用二阶导数符号判断:
- 若 \(f''(x_0)>0\),则 \(x_0\) 为局部极小;
- 若 \(f''(x_0)<0\),则 \(x_0\) 为局部极大;
- 若 \(f''(x_0)=0\),则二阶信息不足以确定性质。
这反映了二阶项在泰勒展开中的主导作用。
2.1.2 Hessian 的正定/负定/不定
在多元情形,若在驻点处 Hessian \(H\) 存在且可用于判别:
- Hessian 正定通常对应局部极小;
- Hessian 负定通常对应局部极大;
- Hessian 不定对应鞍点类型的行为(沿不同方向出现增减混合)。
这里的“通常”来自于需要满足适当的光滑性以及判别定理的前提。
1.2.3 鞍点与“长得像鞍子”的解释
鞍点是指函数在该点附近既存在上升方向也存在下降方向:在某些切向方向上它表现得像“盆地”,在另一些方向上则像“山脊”。二维直观上常用“马鞍面”类比:沿一个方向向上、沿另一个方向向下。驻点在此时并不对应极值,只是局部一阶变化停止。
2.2 高阶导数与退化驻点
2.2.1 泰勒展开的驻点阶数
当二阶判别无法奏效,通常可以看泰勒展开中首次出现的非零项。可把驻点的“退化程度”与“主导阶数”联系起来:若在 \(x_0\) 处低阶导数依次为零,直到某个更高阶的导数不为零,那么该高阶项决定局部形状,从而影响是否可能出现极值。
2.2.2 退化情形:无法仅凭二阶判别
若 Hessian 半正定但不满足严格条件,或 Hessian 为零矩阵,二阶信息不足以确定驻点类型。此时局部行为可能多样,例如出现平坦区域、瘦长凹凸结构或更复杂的混合变化。于是需要借助更高阶展开、结构性条件或其它分析工具。
2.3 局部极值的必要条件
2.3.1 极大/极小的驻点条件
在光滑的一元或多元优化里,局部极值点往往必然满足“驻点”条件(在可导前提下):
- 若 \(x_0\) 是可微函数的局部极大或极小点,则通常有 \(f'(x_0)=0\)(一元)或 \(\nabla f(x_0)=0\)(多元)。
因此,驻点不是充分条件,但常被视为极值搜索的“必要拦截器”。
2.3.2 如何避免“驻点≠极值”的误会(梗:别把驻点当彩票中奖点)
由于驻点可能对应鞍点或更复杂结构,不能把“导数为零”直接等同于“极值必然成立”。类比而言,驻点更像是“结果集中的候选项”:并不是所有停在那儿的点都能最终成为赢家。需要进一步判别(例如 Hessian、泰勒主导项或其他条件)才能确认局部极值性质。
3 与分析工具的联系
3.1 泰勒定理下的驻点行为
3.1.1 局部近似与主导项
泰勒定理给出函数在驻点附近的多项式近似。由于一阶变化率为零,泰勒展开中一阶项消失,二阶及以上项成为局部形状的主导。于是驻点附近的几何轮廓可由这些主导项解释:例如二阶项符号决定凹凸倾向,高阶项则在退化情形中承担判别角色。
3.1.2 误差阶与图像形态
泰勒展开不仅告诉主导项是什么,也提供余项阶数。余项阶数影响近似有效范围;在判别临界时,主导项与余项的相对大小决定“看起来像极小还是只是平坦”。因此,在分析形状或建立严格结论时,需要综合余项估计而非只盯住低阶导数。
3.2 均值定理与驻点的出现机制
3.2.1 可导函数的水平切线逻辑
在一元可导情形,均值定理提供了一种机制:如果函数在两点间出现“净变化为零”的约束(例如 \(f(a)=f(b)\)),那么在区间内必有某处导数为零。该结论可视为“驻点出现”的基本来源之一:当整体倾向被条件抵消,局部必出现水平切线。
3.2.2 从单调性到驻点的推断
导数符号与单调性存在对应关系。若函数在某区间从增到减或从减到增,通常意味着导数在某点附近发生符号变化,从而导数为零的候选点自然出现。这种逻辑在证明极值存在性、估计驻点位置等问题中经常被使用。
3.3 凸分析视角
3.3.1 凸函数的驻点与全局最优
对凸函数而言,局部最优往往具有全局意义。当 \(f\) 是凸且在驻点处满足合适的一阶条件(例如可导时 \(\nabla f(x_0)=0\)),则该点不仅可能是局部极小,更对应全局最小。凸性提供了“没有额外的局部陷阱”,使得驻点判别更强。
3.3.2 凹函数与最大化情形
类似地,对凹函数(即 \(-f\) 为凸)而言,一阶驻点条件对应局部最大并可推广为全局最大。该对偶关系常用于最大化问题的转化:把最大化凹目标转为最小化凸目标的等价问题。
4 变分与优化中的驻点
4.1 无约束优化中的临界条件
4.1.1 梯度为零作为一阶必要条件
无约束优化中,若目标函数可微且希望在某点取得局部极值,则该点通常需要满足一阶必要条件:多元情况下为 \(\nabla f(x)=0\)。这将连续优化问题转化为“寻找驻点”的问题,为理论与算法都奠定了框架。
4.1.2 牛顿法与驻点迭代直觉
牛顿法的核心思想是利用二阶信息逐步逼近驻点。给定当前迭代 \(x_k\),用 Hessian 构造局部二次近似并求解其驻点,从而得到下一步迭代 \(x_{k+1}\)。在较光滑、初值足够接近的情况下,这种“沿着曲率校正”的策略能加速收敛。
4.2 带约束优化的驻点(概要)
4.2.1 拉格朗日乘子法的临界结构
带约束优化通常把约束写成等式或不等式集合。拉格朗日乘子法通过引入乘子,将约束引入目标的一种“等效局部结构”中。此时所谓“驻点”不再是原目标的驻点,而是拉格朗日函数在合适变量与乘子空间中的临界点,刻画了在约束允许方向下的一阶改进被禁止。
4.2.2 KKT 条件与驻点/临界点关系(概念层面)
KKT 条件是带不等式约束优化的经典一阶框架。它包含若干分量(可行性、互补松弛、以及某种广义梯度平衡)。从概念上看,KKT 条件把“驻点”推广为“满足约束几何与一阶平衡”的临界结构;在适当正则条件下,它与最优性紧密相关。
4.3 变分问题的驻点
4.3.1 欧拉-拉格朗日方程作为驻点条件
变分问题中,未知量常通过泛函 \(J[y]\) 的极值来确定。将“驻点”概念迁移到泛函层面,要求在允许的扰动下,一阶变分为零。满足该条件的函数通常被称为极值函数,并由欧拉-拉格朗日方程给出其必要条件。形式上,它对应“泛函的临界条件”,是变分与力学、几何中的核心方程之一。
4.3.2 边界条件对驻点的影响(概念层面)
边界条件决定了允许扰动的范围,从而改变驻点候选的形式。例如固定端点与自由端点对应不同的自然边界条件。因而,在变分问题中,“驻点条件”并不是单独的方程,而是与边界条件共同构成的整体条件;它们共同决定解的可行性与临界结构。