1 概念与基本定义
正定性用于描述某种“能量”或“平方长度”在所有非零方向上的非负性,并进一步区分是否会在某些非零方向上取到零值。最常见的对象是二次型及其对应的对称(或厄米)矩阵:把向量代入后得到的标量表达式若对任意非零向量都严格大于零,则称为正定;若只要求“不小于零”,则称为半正定。
1.1 正定二次型
设二次型记为 \(q(x)\),其中 \(x\) 为变量向量。若满足:对所有非零向量 \(x\neq 0\),都有 \[ q(x)>0, \] 则称 \(q\) 为正定二次型。直观上,它意味着二次型在原点周围不会“塌陷”到平坦方向,能量随偏离而严格增大(至少在数学意义的二次尺度上恒成立)。
1.2 正定矩阵与半正定矩阵
若二次型可写作 \(q(x)=x^{\mathsf T}Ax\)(实情形)或 \(q(x)=x^{*}Ax\)(复情形厄米情形),则矩阵 \(A\) 的正定性与二次型同构。常见约定为:
- 若 \(x^{\mathsf T}Ax>0\) 对所有 \(x\neq 0\) 成立,则 \(A\) 为正定矩阵;
- 若 \(x^{\mathsf T}Ax\ge 0\) 对所有 \(x\) 成立,则 \(A\) 为半正定矩阵。
二者的差别在于:半正定允许存在非零向量使得二次型取值为零,这对应某些方向的“能量退化”。
1.3 正定核与相关对象
“正定核”常见于泛函分析与机器学习的表述中。给定函数 \(K(x,y)\),若对任意有限组样本 \(\{x_i\}\) 与任意实(或复)系数 \(\{c_i\}\),满足 \[ \sum_{i,j} c_i c_j\, K(x_i,x_j)\ge 0 \quad(\text{或严格 } >0 \text{ 在适当条件下}) \] 则称 \(K\) 为正定核或半正定核。核函数对应的 Gram 矩阵(由 \(K(x_i,x_j)\) 组成)继承半正定或正定性质。
1.4 常见术语:内积、度量与范数的联系
正定二次型与内积密切相关。通常将内积写作 \(\langle x,y\rangle\),其伴随的“平方长度”为 \(\langle x,x\rangle\)。当内积满足正定性(\(\langle x,x\rangle>0\) 对 \(x\neq 0\))时,平方长度自然与正定矩阵或正定二次型的思想一致。进一步,在几何与分析中,内积诱导的度量或范数往往依赖这种“严格为正”的性质;而若只满足非负但允许为零,则范数性质会出现退化,需要额外条件才能得到严格意义的距离。
2 等价刻画与判别准则
正定性并非只能用一种方式检验。对于对称或厄米对象,常见的判别准则在数学上等价;在具体计算中则根据数据规模、误差容忍度与可用算法选择最合适的方法。
2.1 特征值刻画
对于实对称矩阵或复厄米矩阵,谱分解与特征值提供了最直接的标准之一。
2.1.1 由谱判断正定性
若 \(A\) 为实对称或复厄米矩阵,则:
- \(A\) 正定当且仅当其所有特征值均为正;
- \(A\) 半正定当且仅当其所有特征值均为非负。
这一定义从“所有方向”的二次型行为转化为“所有模态”的符号检查。实际数值计算中,会把接近零的特征值视作受误差影响的临界量。
2.2 主子式判别(Sylvester 判别法)
主子式判别法把多维问题转化为一系列逐级的行列式符号判断,尤其适用于中小规模的符号推导或可控精度场景。
2.2.1 1×1 到 n×n 的扩展思路
对对称矩阵 \(A\),令其左上角 \(k\times k\) 子矩阵的行列式为 \(\Delta_k\)。Sylvester 判别法表述为:
- 若所有 \(\Delta_k>0\)(对 \(k=1,\dots,n\)),则 \(A\) 正定;
- 若所有 \(\Delta_k\ge 0\) 且满足相应严格性条件,则可得到半正定或更细的判别结果。
这种逐级检查的本质在于它对应于某种等价分解存在性与主方向上的“非退化”。
2.3 Cholesky 分解刻画
Cholesky 分解是面向正定矩阵的经典结构化分解:把矩阵拆成下三角矩阵及其转置的乘积形式。
2.3.1 存在性与唯一性要点
对实对称矩阵 \(A\),若存在下三角矩阵 \(L\) 使得 \[ A=LL^{\mathsf T}, \] 且 \(L\) 的对角元为正,则这种分解与正定性紧密相关:
- 当 \(A\) 正定时,Cholesky 分解存在且对角元取正时唯一;
- 当 \(A\) 仅半正定时,分解可能出现需要更一般形式(例如允许对角元为零或采用广义分解)的情况。
因此,计算中“能否顺利做出 Cholesky”往往可作为正定性强证据;若算法在某一步遇到无法继续的情形,通常意味着正定性不满足或数值误差导致判定边界。
2.4 拉格朗日/二次型视角的判别
从二次型的视角,正定性可理解为“二次项整体支撑”——任何非零方向都不会把二次型压到零或负值。若考虑二次型在子空间上的限制,则其正定或半正定会在相应受限问题上继承(例如用子空间上的二次型值判断局部结构)。
2.5 几何解释:椭球与“能量景观”
当 \(A\) 为正定时,等式 \[ x^{\mathsf T}Ax=1 \] 定义一个椭球(在合适坐标系统下)。进一步,二次型 \(x^{\mathsf T}Ax\) 可视为“能量景观”:原点附近的能量取到最小值且在所有非零方向上严格上升;不存在沿某方向无限延伸的平坦“槽”。若 \(A\) 半正定,则椭球会退化为更一般的二次曲面,出现可能的“平坦面”。
3 与代数结构的关系
正定性不仅是“符号条件”,还与代数对象的结构(如对称性、线性算子、锥)强相关。许多等价刻画依赖于对象具备特定对称或双线性结构。
3.1 对称性、Hermitian 与复数情形
正定性通常要求二次型对应的矩阵具有对称性(实数)或厄米性(复数)。因为对称/厄米结构保证二次型值为实数,并使得特征值与谱分解理论在对应范畴内成立。
3.1.1 复内积下的正定性
在复向量空间中,内积常写作 \(\langle x,y\rangle\),其性质保证 \(\langle x,x\rangle\) 为非负实数。若把二次型写为 \(x^{*}Ax\),则要求 \(A\) 为厄米矩阵(\(A=A^{*}\))才能保证 \(x^{*}Ax\) 的行为与正定性定义一致。在此框架下,“正定”同样对应 \(\langle x,x\rangle>0\) 的严格性,而“半正定”对应 \(\ge 0\) 并允许退化。
3.2 线性算子与双线性形式
二次型可以被视为与双线性形式(或在复情形下的半双线性形式)相关的量。给定双线性形式 \(B(x,y)\),若满足 \(B(x,x)\) 的正定性条件,就可把相关矩阵(在基下的表示)视作具有相同正定性质的对象。换言之,正定性既能“坐在矩阵里”,也能“坐在双线性形式里”。
3.3 双线性形式的矩阵表示变换
在改变基(或坐标)时,矩阵表示会发生相似/保合同构变换。对于由对称(厄米)结构诱导的二次型,正定性在这类变换下保持不变,因为它本质上是对所有向量方向的取值符号性质。也正因此,判别准则常以不变性为基础建立。
3.4 正定锥与康斯特鲁克(cone)概念
半正定或正定矩阵集合在合适的向量空间中形成锥结构。所谓“锥”,强调在非负缩放下封闭,并具有“把对象累加仍保持在集合内”的性质(在半正定情形尤其明显)。这一几何代数结构在凸分析、半定规划以及相关优化模型中十分常用:目标与约束常常写成“矩阵在某个正定锥内”的形式。
4 性质与运算规则
正定性在运算与结构操作中具有可预测的行为。理解这些规则能帮助在推导、建模与数值实现时避免错误。
4.1 线性变换下的保持性
若 \(A\) 正定,且 \(T\) 为可逆线性变换,则由 \[ T^{\mathsf T}AT \] 构造的新矩阵仍为正定。直观原因是:二次型在向量空间中换了“坐标”,但对所有非零向量的严格正性不会消失。半正定情形同理,不过允许出现零方向导致的退化。
4.2 加法、数乘与Schur补的相关性
- 加法:两个半正定对象的和仍半正定;若它们在某些意义下不“同时退化”,和甚至会变得正定。
- 数乘:正定与半正定在乘以正标量后保持性质;乘以非正标量会翻转符号或破坏正定结构。
- Schur 补:在分块矩阵分析中,Schur 补常用来把高维正定性转化为低维条件。其典型用途是:通过检查某个块与相应补块的正定性,判断整体矩阵的正定性。
4.3 子矩阵与主子阵的影响
对称矩阵的正定性与主子阵之间存在紧密联系。特别地,正定矩阵的任何主子阵也会保持正定;而半正定情形中,主子阵仍半正定。这说明正定性是一种“具有向下继承”的全局性质。
4.4 秩、核空间与严格性差异
严格性(正定 vs 半正定)体现在核空间中:
- 正定意味着核空间仅包含零向量,即 \(\ker(A)=\{0\}\);
- 半正定允许存在非零向量落在核中,使得二次型为零。
因此,秩的降低通常对应“失去严格性”的发生。数值上,这也对应到出现接近零的模态与可能的病态。
4.5 极限与连续性:从半正定到正定
半正定集合与正定集合之间关系可由“扰动”理解:正定性是半正定的严格版本。若半正定矩阵在某些方向上退化,则通过对主对角或谱进行微小正向扰动,有可能使其变成正定。反过来,正定矩阵也能以极限形式逼近半正定边界。连续性思想常用于算法的稳定设计与容差设置。
5 应用导向的典型场景
正定性在应用中多以“保证唯一性、稳定性或凸性”的角色出现。下列场景展示其常见落点。
5.1 凸优化中的二次型与Hessian正定性
在许多优化问题中,目标函数的二阶信息由 Hessian 矩阵描述。若在某点附近,Hessian 为正定,则该点常被视为局部最优的强候选(对应二次近似严格上开)。而若 Hessian 仅半正定,则可能得到较弱的结论:局部最小仍可能出现,但平坦方向会让“严格最小”变得不那么确定。
5.1.1 局部极小与二阶充分条件(概念层面)
二阶充分条件的核心思想是:二次项的正定性排除了沿非零方向下降的可能,从而支撑“在该点附近,函数值不低于该点”。当严格性缺失时,可能出现谷底方向或非孤立极小结构。
5.2 数值线性代数中的稳定性
正定矩阵的结构常带来更稳定的数值行为:分解与迭代方法更容易保证收敛性与误差可控性。
5.2.1 条件数与正定结构的利用
在许多正定系统求解中,条件数与谱分布直接相关。若最小特征值远离零,则系统“更可解、更不敏感”;这对应正定性提供的严格性。算法可利用对称性与谱性质来设计更快、更稳健的实现策略。
5.3 统计与机器学习中的核函数(正定核)
正定核可以保证由样本生成的 Gram 矩阵半正定,从而使某些学习模型的目标函数具备凸性或可解性基础。许多核方法在理论上依赖于“核矩阵非负”的性质来确保损失函数的可行与几何解释的成立。
6 计算与实践方法
在真实计算中,正定性的判别需要兼顾速度与数值误差。不同方法的适用条件与失败模式各不相同。
6.1 如何高效判别:从特征值到分解
一般可按“证据强度”与成本选择:
- 直接算特征值能给出明确判定,但在大规模情形成本高;
- 分解类方法(如 Cholesky)通常更高效,也能直接利用正定结构;
- 采用迭代或近似谱技术时,需要处理阈值与容差(把理论零与数值接近零区分开)。
6.2 主子式法的计算注意事项
主子式判别涉及行列式的符号与大小,可能出现数值放大或下溢问题。即便理论上只看符号,实际浮点误差也可能使符号翻转。为保证可靠性,往往需要结合尺度归一化或采用更稳定的替代实现。
6.3 Cholesky的实现要点与失败原因
Cholesky 实现通常依赖逐步更新对角项并要求其为正(或至少为非负)。失败常见于:
- 输入矩阵并非对称或厄米,导致理论条件被破坏;
- 矩阵接近半正定边界,数值误差把本应为零的量变成负;
- 数据噪声或舍入使得严格正性在浮点层面难以维持。
实践中常采用对称化处理(例如取 \((A+A^{\mathsf T})/2\))或设置容差来稳定判别。
6.4 大规模情形的近似判别策略
当维度很大,通常不直接做完整特征分解。常用策略包括:
- 只估计最小特征值或谱下界;
- 使用带有预条件的迭代方法推断正定性倾向;
- 在优化算法中结合“分解能否进行”作为动态判断信号。
这些做法的共同点是:正定性判定通常以“近似、容差、概率或经验准则”形式出现,需要与应用目标匹配。
7 反例与易错点(轻量化辨析)
正定性概念看似直观,但在条件、对象类型与维度上常被混淆。
7.1 半正定≠正定:零特征值的角色
半正定允许存在非零向量 \(x\neq 0\) 使 \(x^{\mathsf T}Ax=0\)。因此不能仅凭“非负看起来都对”就断言正定。若某些方向能让二次型恰好为零,那就失去严格性。
7.2 非对称矩阵为何不能直接用同一标准
标准判别(如特征值符号与 Cholesky)通常要求对象具备对称或厄米结构。非对称矩阵的二次型可能不产生同样的实数谱解释;即使 \(x^{\mathsf T}Ax\) 在某些情况下表现为非负,也不等同于对称情形下的严格正定判定逻辑。
7.3 维度不匹配与“方向性”的误解
正定性面向“所有非零向量”的性质。易错点包括:
- 只在某个子集(例如坐标轴方向)检查,而忘了可能存在其他方向的反例;
- 在不同空间(不同维度或不同内积结构)间混用条件,导致结论不再成立。
正定性是全方向约束,而不是局部抽样通过就成立。
7.4 梗:把“正定”当“正经”但其实不是(概念玩笑)
在中文语感里,“正定”容易被误读成“正经”。然而在数学里,它与“严肃不严肃”没有关系:真正的含义来自二次型在所有非零方向上的严格符号行为。换句话说,数学的“正”指的是取值方向,不是态度。
8 相关主题与扩展阅读
正定性与不定性、度量几何与内积空间结构等概念相互牵连。理解这些相邻主题有助于把正定性放回更大的理论框架中。
8.1 半正定性与不定性
与正定对应的是不定(indefinite)结构:二次型在不同方向上可能同时出现正与负值。半正定与不定之间的边界往往由“零特征值”或“谱穿越零点”的过程刻画。
8.2 度量、黎曼几何中的正定张量(概念关联)
在黎曼几何中,度量张量在每个切空间上提供正定的内积结构。其正定性确保长度与角度的几何意义良好,并使得相关几何量能够作为“真实距离”的基础。
8.3 Gram矩阵与内积空间结构
Gram 矩阵由一组向量的内积构造,典型地是半正定的;若向量组线性无关,则常能对应到更强的正定性质。Gram 矩阵把“内积结构”转化为矩阵可计算对象,从而成为判别正定性的常用入口。
8.4 Gram-Schmidt 与正定结构的生成
Gram-Schmidt 过程把一组向量正交化,并与内积结构直接相关。若起始结构来自正定内积,则正交化过程中得到的基与相关性质能反映内积空间的非退化特征。它也可以作为从抽象内积到具体坐标表达的一种生成方法。