1 词条定义与直观理解

1.1 误差与绝对误差概念

在估计、预测或模型输出的语境中,通常先定义“真值”或“目标量”,再给出某个候选方案的输出。候选方案与目标量之间的差称为误差。绝对误差则是误差取绝对值后的量,用于衡量偏离程度与偏离方向无关。由于绝对值始终非负,它更适合表达“离目标有多远”的直观距离。

1.2 “最小化 |误差|”的选择逻辑

“绝对误差最小”指在一组候选结果之间进行选择:对每个候选计算其误差的绝对值,然后选取绝对误差最小的那个。该准则可以视作一种判据(或损失最小化准则),其基本结构是“逐候选度量—比较—取最优”。它不关心误差是正还是负,只关注幅度。

若把候选理解为若干离散估计值、多个模型的预测结果,或不同策略生成的预测点,那么该准则等价于选择“离目标最近”的输出(在绝对距离意义下最近)。

1.3 与常见误差口径关系(绝对值)

在实践中常见的误差口径包括平方误差、绝对误差等。平方误差会对大误差进行更强的放大,而绝对误差对偏差的惩罚呈线性增长(相对更温和)。因此,当误差分布存在少量异常点或厚尾波动时,绝对误差最小的选择往往更不容易被少数极端偏差主导;这使其在一些鲁棒性需求较高的场景下具有吸引力。

2 数学表述

2.1 误差的基本形式

设目标量为 \(y\),候选输出为 \(\hat y\)。则误差为 \[ e=\hat y-y. \] 绝对误差为 \[

e=\hat y-y.

\] 当讨论多个数据点或多维情形时,常将误差扩展为对每个分量或样本的偏差,并据此构造总体损失;但核心仍是绝对值度量。

2.2 判据的标准写法

对离散候选集合 \(\{\hat y^{(k)}\}\),绝对误差最小的选择规则可写为 \[

k^\*=\arg\min_k \left\hat y^{(k)}-y\right.

\] 相应地,选择 \[

\hat y^{(\,k^\*\,)}=\arg\min_k \left\hat y^{(k)}-y\right.

\] 若是单次决策问题,这就是最直接的“比较—取最小”。

在多样本情形中,常见写法是将总体目标函数设为各样本绝对偏差之和或平均,例如 \[

\min_\theta \sum_{i=1}^ny_i-f_\theta(x_i)

\] (这里 \(f_\theta\) 表示带参数的模型,\(\theta\) 为待估参数)。

2.3 目标函数与优化问题的对应

当候选方案由参数 \(\theta\) 连续控制时,“绝对误差最小”对应的是一个优化问题。其典型形式是 \[

\min_\theta \; \mathcal{L}(\theta)=\sum_{i=1}^ny_i-f_\theta(x_i)

\] 或更一般地用期望风险表示。该目标函数由绝对值构成,因此在数学性质上不同于平方误差:它通常是分段线性或分段光滑的,从而带来不同的最优性条件与算法实现方式。

3 统计场景中的应用

3.1 参数估计中的绝对误差最小

在参数估计中,若以绝对偏差作为损失,就可以通过最小化总体绝对误差来得到估计量。这类方法常被概括为“基于 \(L_1\) 损失的估计”。直观上,它把每个样本的预测偏差转化为线性惩罚,再在全体样本之间寻找使总惩罚最小的参数。

当误差中存在偶发异常(例如数据录入错误、测量瞬间飘移等)时,绝对损失相对不那么“敏感”,因此在某些数据质量不稳定的任务中更合适。

3.2 预测/回归中的绝对误差准则

在回归预测中,绝对误差准则对应于以 \[

\sum_iy_i-\hat y_i

\] 作为目标来训练或选择模型。例如在选择某个固定形式的预测函数(或某次迭代产生的候选模型)时,比较其在训练样本上的绝对偏差大小,往往能反映其“整体离目标的距离”表现。

这类准则也常用于构造鲁棒的预测器:当异常点较少但偏差可能很大时,平方误差可能被大偏差强行拉动,而绝对误差更倾向于“平均地处理”多数样本。

3.3 选择规则与决策准则的区别

需要区分“选择规则”和“决策准则”。在简单问题中,绝对误差最小直接决定选择哪个候选输出;这时它更像是明确的选择规则。但在统计学习中,训练阶段往往是在最小化经验损失以形成决策函数;这时可视为一种决策准则(即用某种损失作为衡量标准来指导学习与决策)。

两者都围绕同一思想:用绝对误差度量偏离程度并寻找最优,但它们在表述层面更侧重不同环节(选择候选 vs 训练得到策略)。

4 与其他最小化准则的对比

4.1 最小二乘(平方误差最小)

最小二乘通过最小化平方误差: \[ \min \sum_i (\hat y_i-y_i)^2. \] 由于平方函数对大误差的惩罚是非线性的增长,平方误差会显著放大离群点影响。当数据包含偶发极端偏差时,最小二乘的解可能被少数点“牵着走”。

相比之下,绝对误差随误差幅度按线性方式变化,因此对极端误差的主导程度通常更低。

4.2 最大似然与绝对误差的联系(概念性对照

最大似然是一种基于概率模型的准则。概念上,当误差模型假设为某种分布时,不同的“负对数似然”会对应不同的损失函数形式。在某些常见设定下,绝对误差与最大似然之间存在对应关系:例如当误差服从合适的分布(其概率密度与绝对偏差呈线性相关的形式)时,最大似然等价于最小化绝对偏差的总和。

因此,绝对误差最小可以被理解为在特定误差分布假设下的“概率推导式最优”,而不仅仅是纯粹的几何距离度量。

4.3 鲁棒性差异:对离群值的影响

鲁棒性差异可用“惩罚曲线”来直观理解。平方误差的曲线在远离零点时迅速升高,使得离群点的影响增长更快;绝对误差的增长相对恒定,因此当出现少数极端偏差时,整体最优解往往更受多数样本约束,表现出更稳健的倾向。

这种差异也会影响到模型的收敛路径和最终解的形状:绝对损失的非光滑性与离群值的权重分配共同作用,使其与最小二乘形成对照。

5 性能与性质(概念层面)

5.1 损失函数视角:L1损失

从损失函数角度,绝对误差最小对应 \(L_1\) 损失。其核心特点是对每个样本误差的惩罚与 \(e\) 成正比。该性质使得它在误差分布存在偏态、厚尾或离群点时,往往比平方损失更不容易被极端值扭曲。

在统计与机器学习中,\(L_1\) 损失还以“产生稀疏或边界解”的潜在可能而闻名,但是否出现稀疏结构取决于模型形式与约束条件;本文主要关注其与绝对误差判据的一致性:即线性惩罚与绝对值结构。

5.2 平衡偏差与波动的直觉

绝对误差最小的目标不是“更大偏差越乘越多”,而是“偏差幅度每增加固定量就增加固定惩罚”。因此它更像是在用线性成本来平衡所有误差:少数大偏差不会以指数式方式把整体目标拉偏,系统会更强调多数点的整体贴合。

在某些情形下,最优解倾向于让误差正负两侧在绝对值衡量下达到一种“折中”,从而提供更稳定的中心位置或更抗扰动的估计。

5.3 可能出现的非光滑性与解的含义

绝对值函数在零点处不可导(存在拐点),因此当目标函数包含 \(\cdot\) 时,优化过程可能遇到非光滑问题。其结果通常表现为:
  • 最优点可能位于“拐点附近”,对应某些样本误差恰好为零或符号发生变化;
  • 最优解可能不是严格唯一,存在多个候选都能达到相同的最小绝对误差。

从解释角度看,这意味着最优解的形成机制更依赖于误差符号与相对幅度,而不是平方损失那种光滑曲面上的连续“向下爬坡”。

6 计算与实现

6.1 直接遍历式选择(离散候选)

当候选方案只有有限个(例如若干候选估计值、网格预测结果),最直接的方法是遍历:对每个候选计算绝对误差并比较取最小即可。其优势在于实现简单、结果可靠;代价则是候选数量大时代价增加。

在离散情形中,“非光滑性”并不会直接带来计算难题,因为我们不需要沿梯度方向求解,只需比较目标值。

6.2 连续候选下的求解思路

当候选输出由连续参数控制时,需要进行优化。对于包含绝对值的目标函数,常见思路包括:

  • 将问题改写为等价的线性规划形式(利用绝对值可分解为正负部分的引入);
  • 或采用专门处理非光滑目标的数值方法,通过次梯度/分段结构进行迭代。

这些方法的共同点是:认识到绝对值导致的拐点结构,并据此构造适合的求解器,而不是直接套用基于二阶导数的最小二乘套路。

6.3 与数值优化方法的适配(非光滑优化直觉)

绝对误差最小对应的优化任务属于非光滑优化范畴。实践中常见的适配方式包括:

  • 使用能够处理 \(L_1\) 或一般非光滑目标的优化框架;
  • 结合问题的结构(线性、分段线性、凸性等)选择更合适的算法;
  • 在目标函数凸时,通常可以获得更稳定的收敛行为;在非凸模型里则更依赖具体初始化与算法策略。

由于绝对值目标可能产生“平坦区间”或“多解”,算法在实现细节上需要关注停止准则与解的选择方式。

7 例子与轻量“梗”式理解

7.1 一个最小绝对误差的简单算例

设目标量为 \(y=10\),有三个候选输出:\(8, 10, 13\)。计算绝对误差:

- 候选 \(8\):\(8-10=2\)
- 候选 \(10\):\(10-10=0\)
- 候选 \(13\):\(13-10=3\)

由于最小绝对误差为 \(0\),因此选择输出 \(10\)。这个例子直观展示了该判据“选离目标最近者”的本质。

7.2 “误差越大,惩罚越线性”的直观记忆法

可以用一句话记忆:绝对误差准则让惩罚随误差幅度“按比例上涨”。当误差从 1 变为 2,惩罚也从某个基准翻倍;从 2 变为 5,则惩罚对应以线性方式增加。

因此,它不像平方误差那样在大误差处急剧升高,更像一个“线性计费”的度量器。

7.3 常见误区:把“最小绝对误差”当成“最小平方误差”

一个常见误解是将“绝对误差最小”与“最小二乘”混为一谈。二者的目标函数分别是 \(e\) 与 \(e^2\)。由于平方项会显著放大大偏差,二者在存在离群点时通常会选择不同的解或导致不同的拟合结果。

因此在阅读文献或实现代码时,应检查损失函数是否真的使用绝对值,以及是否把模型训练目标与评估指标混淆。