1 向量范数的基本概念
1.1 定义与公理化性质
| 向量范数是定义在向量空间中的一个函数,用于衡量向量的“大小”。设向量空间为 \(V\),对任意 \(x\in V\),范数记为 \(\|x\|\in \mathbb{R}_{\ge 0}\)。范数通常满足四类公理化性质: | ||
|---|---|---|
| 1. 非负性:\(\|x\|\ge 0\)。 | ||
| 2. 正定性:\(\|x\|=0\) 当且仅当 \(x=0\)。 | ||
| 3. 齐次性:对任意标量 \(\alpha\),有 \(\|\alpha x\|= | \alpha | \,\|x\|\)。 |
| 4. 三角不等式:\(\|x+y\|\le \|x\|+\|y\|\)。 |
这些条件共同保证了范数可被理解为与几何长度相协调的量,而不仅仅是任意的度量函数。
1.2 范数与“长度”直觉的对应
在欧几里得空间中,长度直觉来自点到原点的距离。范数抽象了这种直觉:
- 范数把向量映射到非负实数,使得“越大”意味着在某种度量意义下更“远”或更“显著”。
- 在不同范数下,“长度”的含义会改变,例如对分量的侧重不同,从而导致不同的几何形状与优化行为。
1.3 范数诱导的距离
| 给定范数 \(\|\cdot\|\),可定义两个向量 \(x,y\) 之间的距离 |
|---|
\[
| d(x,y)=\|x-y\|. |
|---|
\] 由于范数满足非负性、正定性、齐次性与三角不等式,上式自然满足距离的公理,因此 \((V,d)\) 成为度量空间。直观上,距离是由“差向量的大小”决定的。
1.4 范数的齐次性与三角不等式
齐次性刻画了“缩放行为”:把向量按比例放大,范数按同样比例放大(取绝对值)。 三角不等式刻画了“叠加约束”:两个向量的合成不可能比它们各自大小之和更大得离谱。该性质是范数在收敛性、误差估计与凸性分析中反复出现的根源。
2 常见向量范数
2.1 ℓ1 范数(曼哈顿型)
对向量 \(x=(x_1,\dots,x_n)\),定义 \[
| \|x\|_1=\sum_{i=1}^n | x_i | . |
|---|
\] 它常被称为“曼哈顿型”,因为在二维网格上,沿坐标轴移动的总步数与该量相对应。该范数对分量的“累加”更敏感。
2.2 ℓ2 范数(欧几里得型)
\[
| \|x\|_2=\left(\sum_{i=1}^n x_i^2\right)^{1/2}. |
|---|
\] 它与欧几里得几何中的距离一致,因此常用于能量度量、最小二乘目标与许多基于平方误差的模型。
2.3 ℓp 范数的一般形式
对 \(p\ge 1\),定义 \[
| \|x\|_p=\left(\sum_{i=1}^n | x_i | ^p\right)^{1/p}. |
|---|
\] 当 \(p=1\) 与 \(p=2\) 时分别回到 \(\ell_1\) 与 \(\ell_2\)。随着 \(p\) 增大,范数对较大的分量会逐步更敏感。
2.4 ℓ∞ 范数(最大范数)
\[
| \|x\|_\infty=\max_{1\le i\le n} | x_i | . |
|---|
\] 它反映“最大分量主导”的量纲:只要某个坐标的绝对值很大,范数就会随之增大。因而它适合描述最大误差或最坏情况的指标。
2.5 其他常用变体:加权范数、分组范数
- 加权范数常用于不同分量具有不同重要程度的情形。例如给定权重 \(w_i>0\),可用
\[
| \|x\|_{1,w}=\sum_i w_i | x_i | \quad \text{或}\quad \|x\|_{2,w}=\left(\sum_i w_i x_i^2\right)^{1/2}. |
|---|
\]
- 分组范数用于把多个变量视作一个整体来处理,常见形式是对每组计算某种子范数再做汇总,从而鼓励“整组”稀疏或结构化稀疏。
3 范数之间的关系
3.1 范数等价(有限维情形)
在有限维向量空间中,任意两种范数都是等价的:存在常数 \(c,C>0\),使得对所有 \(x\) 有 \[
| c\|x\|_a \le \|x\|_b \le C\|x\|_a. |
|---|
\] 这意味着从“拓扑结构”的角度看,它们产生相同的收敛概念与开集结构。然而,等价并不代表数值效果相同,尤其在迭代算法或统计推断中,常数因子与几何形状仍会显著影响结果。
3.2 范数比较不等式与估计技巧
常见的比较结论基于 \(\ell_p\) 范数的单调性与不等式工具。例如对有限维空间可得到随 \(p\) 变化的上下界,从而把一种范数的估计转化为另一种范数的估计。 这些技巧常用于:
- 证明序列在某种范数下收敛时在另一种范数下也收敛;
- 在误差分析中把不同误差指标之间的界联系起来。
3.3 极限范数:p→1、p→∞ 的直观联系
| 当 \(p\to 1\) 时,\(\|x\|_p\) 的行为趋向于对分量绝对值的线性汇总;当 \(p\to\infty\) 时,范数逐渐接近最大分量的主导效应。 |
|---|
这提供了一种直观桥梁:小 \(p\) 更像“整体累加”,大 \(p\) 更像“最强者胜出”。
3.4 在不同范数下的几何差异
尽管有限维中范数等价,但几何图像可能非常不同。单位球
| \(\{x:\|x\|\le 1\}\) 在不同范数下形状差异明显: |
|---|
- 在 \(\ell_1\) 下,单位球通常呈“菱形”(高维为类多面体)。
- 在 \(\ell_2\) 下,单位球为圆球/球体,边界光滑。
- 在 \(\ell_\infty\) 下,单位球表现为“立方体状”的棱面结构。
这些差异会影响最优解的位置、约束可行域的触达方式以及误差传播的方向敏感性。
4 范数的几何与分析性质
4.1 单位球、单位球面与形状特征
单位球是描述范数几何最直接的对象: \[
| B=\{x:\|x\|\le 1\},\quad S=\{x:\|x\|=1\}. |
|---|
\] 单位球的边界曲率、是否光滑、是否存在棱角等特征,往往决定了优化问题中“触点”与“法向”结构的复杂程度。例如带棱角的单位球通常对应非光滑的几何约束。
4.2 方向依赖与等值线/等距曲线
| 在 \(\ell_p\) 范数下,等值集合 \(\{x:\|x\|_p=r\}\) 随 \(r\) 缩放而变化,其形状揭示方向差异: |
|---|
- 某些范数更强调坐标轴方向(例如 \(\ell_\infty\))。
- 某些范数更均衡地对待各方向(例如 \(\ell_2\))。
因此,等距曲线的“密度分布”不同,会使得算法在不同方向上的步长策略、收敛速度呈现差别。
4.3 收敛性与连续性的刻画
| 在度量诱导下,若 \(x_k\to x\) 意味着 \(\|x_k-x\|\to 0\),则连续性可用范数控制来表达:函数 \(f\) 在点 \(x\) 连续通常可表述为当 \(\|h\|\) 足够小时,\(f(x+h)\) 与 \(f(x)\) 的差在目标范数下也足够小。 |
|---|
在有限维中,由于范数等价,连续性与收敛性不随范数的具体选取而改变;但在无限维情形中,范数选择可能影响更深层的性质。
4.4 投影与误差度量的范数视角
投影通常指把向量映射到某个集合或子空间,使得误差“最小”。误差最小取决于所采用的范数:
因此,误差度量的选择直接改变“最优投影”的含义。
5 与优化问题的联系
5.1 范数作为正则项的角色
| 在优化与学习中,常将 \(\|x\|\) 用作正则项(regularizer),用于控制解的规模、提升泛化或引入结构偏好。由于范数常是凸函数(当其满足常见条件时),它们可与损失函数共同构成凸或近似凸的优化模型。 |
|---|
5.2 ℓ1 范数与稀疏恢复(直观应用)
| \(\ell_1\) 范数倾向于产生稀疏解:在许多压缩感知或特征选择情形中,最小化 \(\|x\|_1\) 能鼓励大量分量为零或接近零。直观原因是 \(\ell_1\) 的单位球带棱角,约束/等损失集合与之相交时更容易在坐标轴附近发生“拐点触达”。 |
|---|
5.3 ℓ2 范数与最小二乘/能量最小化
\(\ell_2\) 范数对应平方误差的自然结构:在最小二乘问题中,目标常可写作残差向量的 \(\ell_2\) 范数平方。该框架与能量、噪声的高斯假设等常见模型具有紧密联系,因此在理论与实践中应用广泛。
5.4 ℓ∞ 范数与最坏情况优化
| \(\ell_\infty\) 关注最大分量误差。把 \(\|x\|_\infty\) 用作目标或约束时,优化器会倾向于“压平”最坏坐标的偏差,获得更强的鲁棒性视角。 |
|---|
在工程上,这类做法适合处理“不能让某一项超出上限”的需求。
5.5 次梯度与凸分析中的范数
当范数不可微(如 \(\ell_1\) 与 \(\ell_\infty\) 在某些点上)时,通常使用次梯度(subgradient)来刻画一阶最优性条件。范数的凸性保证了次梯度存在,并能用于构造KKT条件、证明收敛与分析阈值结构。 因此,范数不仅是度量工具,也是凸分析中的核心对象。
6 数值计算中的应用
6.1 条件数、尺度与范数选择
在数值线性代数中,“同一问题换范数等价于改变度量”,从而影响条件数的表现。条件数用于衡量问题对扰动的敏感度,范数的选择会改变误差放大估计中的常数,从而影响稳定性判断与算法选择。
6.2 误差度量与鲁棒性分析
误差分析往往要回答“误差从哪里来、影响多大”。当采用某种范数度量误差时,分析会对误差方向产生偏好:
- 使用 \(\ell_2\) 常对应平均意义下的扰动能量。
- 使用 \(\ell_\infty\) 则对应坐标最大扰动的上界。
因此,鲁棒性结论与所选范数的解释密切相关。
6.3 约束优化中范数的实现要点
| 在约束优化里,约束集合常由范数定义,例如 \(\|x\|\le r\)。数值实现通常需要: |
|---|
- 把约束转换为可处理的形式(例如锥优化、投影算子或近端算子);
- 选择与所选算法匹配的计算手段(投影法、坐标下降、近端梯度法等)。
由于不同范数的单位球几何差异显著,实现难度和计算成本会不同。
6.4 计算复杂度与工程实践
在工程实践中,常以“可计算性”为导向选择范数:
- 一些范数的投影或近端算子可有闭式解(计算快)。
- 某些结构化范数(如分组范数)可能需要更复杂的子问题求解。
因此,范数选择常是数学表达能力与计算成本的折中。
7 典型例子与计算方法
7.1 低维示例:ℝ2 中的具体比较
设 \(x=(x_1,x_2)\)。则:
| - \(\|x\|_1= | x_1 | + | x_2 | \); |
|---|---|---|---|---|
| - \(\|x\|_2=\sqrt{x_1^2+x_2^2}\); | ||||
| - \(\|x\|_\infty=\max( | x_1 | , | x_2 | )\)。 |
在二维平面中,不同范数的单位边界形状直接可视化:\(\ell_1\) 的菱形、\(\ell_2\) 的圆、\(\ell_\infty\) 的正方形,能帮助理解“同一个向量在不同度量下看起来有多大”。
7.2 高维示例:稀疏向量在 ℓ1 下的效果
| 考虑高维向量且只有少数分量非零。此时 \(\|x\|_1\) 只会对这些非零项累加,而 \(\|x\|_2\) 会对平方后再开方,二者都能反映规模,但 \(\ell_1\) 更容易把优化引导到“零分量更突出”的区域。 |
|---|
这在特征选择与稀疏重建的直觉中尤为常见。
7.3 归一化与单位范数化
归一化是把向量缩放到单位范数,如定义 \[
| \hat{x}=\frac{x}{\|x\|}. |
|---|
\] 在数据预处理、相似度比较与迭代算法中很常用。不同范数的归一化会得到不同“单位化”表示,从而影响后续模型对尺度的敏感度。
7.4 范数的数值实现与注意事项
数值实现中需要注意:
- 避免不必要的上溢/下溢(尤其是大 \(p\) 或高维场景);
| - 对接近零的量进行稳定处理,例如计算 \(\|x\|_p\) 时可能需要适当的缩放; |
|---|
- 在比较或归一化时,确保使用与理论一致的范数定义,避免把平方误差直接误当成范数或反之。
8 相关概念与扩展
8.1 从向量范数到矩阵范数(桥接概念)
矩阵范数可看作对线性变换大小的度量,常用于算子扰动分析与数值稳定性研究。向量范数可用于诱导矩阵范数,例如通过“最大拉伸比例”来定义,从而把向量层面的度量推广到算子层面。
8.2 从范数到度量空间
| 如前所述,范数可诱导距离 \(d(x,y)=\|x-y\|\)。这一步把代数结构(向量空间)与拓扑/分析结构(度量空间)连接起来,使得收敛、连续、紧性等概念可以用统一的语言表达。 |
|---|
8.3 引入内积与范数:∥x∥=√⟨x,x⟩
若向量空间配备内积 \(\langle \cdot,\cdot\rangle\),则可由 \[
| \|x\|=\sqrt{\langle x,x\rangle} |
|---|
\] 构造范数。此时范数与内积之间满足更强的几何结构,例如正交、投影与柯西—施瓦茨不等式等经典性质更容易发挥作用。
8.4 范数在函数空间中的对应(概览级)
在函数空间中,范数常通过对函数值或导数的积分/取极值来定义,例如把函数当作“无限维向量”。这使得 \(\ell_p\) 的思想推广到 \(L^p\) 空间与相关范数体系。该扩展在偏微分方程、变分法与泛函分析中具有基础地位。
9 常见误区与“梗式”提醒
9.1 把范数当作距离的适用条件
| 范数诱导距离的方式是 \(d(x,y)=\|x-y\|\)。误区在于:把任意非负函数直接当距离,或忽略三角不等式与正定性这些关键条件。简单说:没有满足范数公理的“长度感”可能只是自嗨。 |
|---|
9.2 认为不同范数在有限维中“完全一样”的误解
有限维下范数等价意味着收敛性等拓扑性质一致,但几何形状和数值表现仍可能差别很大。等价不等于“观感相同”,也不等于“算法表现完全一致”。
9.3 “最小二乘不一定等于 ℓ2”的轻松纠偏
最小二乘通常与 \(\ell_2\)(残差的平方)联系紧密,但在更一般的设定里,若目标包含权重、变换或使用其他误差度量,“最小二乘”这个口号可能会失去与 \(\ell_2\) 的一一对应。核对定义:到底在最小化哪一种范数(或其平方)是关键。
9.4 规格化尺度导致的看似矛盾现象
同一个向量如果先做了不同范数下的归一化,再拿去比较或代入模型,结果可能看起来“互相打架”。很多时候不是理论冲突,而是尺度选择改变了输入含义。回到最初:你到底在用哪一种范数作为度量与归一化标准?