1 概念与定义
似然函数是在统计推断中,用来衡量“在某个参数取值下,观测数据出现的相对程度”的函数。其核心做法是固定观测样本,将模型参数视为变量,从而得到一个关于参数的函数。与概率密度或概率质量函数不同,后者通常以观测结果为变量、参数为条件;而似然的解释重点在于:给定数据时,不同参数对应的“解释力”如何比较。
1.1 似然函数的直观理解
直观上,可以把似然理解为一种“对参数的评分”。当参数取某个值时,模型会生成与观测数据相似的概率结构;于是似然函数在该参数附近往往取较大值。更重要的是,似然强调的是参数之间的相对比较,而不要求它像概率分布那样对所有参数取值归一。
1.2 从概率模型到似然的构造
设统计模型用概率分布表示:给定参数 \( \theta \) 时,观测数据 \(x\) 的概率(离散情形)或密度(连续情形)为
- 离散:\(p(x\mid \theta)\)
- 连续:\(f(x\mid \theta)\)
固定观测数据 \(x\) 后,把右侧视为参数的函数,就得到似然函数。常见记号为 \[ L(\theta)=p(x\mid \theta)\quad\text{或}\quad L(\theta)=f(x\mid \theta). \] 因此似然的数学来源就是概率模型本身,只是“谁是变量、谁是条件”的解释发生了变化。
1.3 概率与似然的解释差异
概率解释通常回答“如果参数取某值,某个观测结果发生的可能性有多大”;而似然解释回答“在观测结果已知时,不同参数对该观测结果的解释程度如何”。因此,即便形式上相同(例如同样是某个密度函数的表达式),在统计推断语境下,似然被用作比较或优化目标。
1.4 记号约定与常见写法
实际写作中常见的写法包括:
- 把似然记为 \(L(\theta)\) 或 \(\ell(\theta)\)(其中 \(\ell\) 常指对数似然)。
- 若数据为独立同分布样本 \(x_1,\dots,x_n\),则似然常写为乘积形式:
\[ L(\theta)=\prod_{i=1}^n p(x_i\mid \theta)\ \ \text{或}\ \ \prod_{i=1}^n f(x_i\mid \theta). \]
- 在连续情形中,密度可能为小于 1 的数,但这并不妨碍其作为相对评分的作用。
2 数学形式与性质
在多数应用中,似然函数的“乘积结构”和“对数域的加和结构”决定了其计算与优化方式。其性质也与参数变换、单调变换以及可导性等条件密切相关。
2.1 离散与连续情形
离散情形下,似然使用概率质量函数: \[ L(\theta)=p(x\mid \theta). \]
连续情形下,似然使用概率密度函数: \[ L(\theta)=f(x\mid \theta). \]
当观测由多个样本组成且条件独立时,二者均可写成对样本的乘积,从而在对数域上化为求和。
2.2 归一化常见误区
似然函数对参数而言一般不满足“归一化为 1”的要求。因为似然并不被当作参数的概率分布;它的用途往往是比较不同参数下的解释程度。若对似然进行任意常数倍缩放,最大化结果与比大小关系通常保持不变(在很多方法中只关心相对大小或对数差异)。
2.3 参数变换下的协变性与不变性
若对参数做可逆变换,例如 \(\phi=g(\theta)\),则似然函数作为“由模型生成数据概率表达式构成的函数”会随参数表达方式一起改变。
- 在最大化意义下(如 MLE),在合理条件下最大点会按参数变换相应映射,体现出“最大化目标的形式不依赖于参数表述”的特征。
- 但如果把似然当作要积分为 1 的对象,则会引入额外的变换因子(例如雅可比行列式),这通常不属于经典似然的标准解释框架。
2.4 单调变换与最大化等价性
对似然取对数是一种严格单调变换,因此不会改变最大点: \[ \arg\max_\theta L(\theta)=\arg\max_\theta \ell(\theta),\quad \ell(\theta)=\log L(\theta). \] 此外,任何对 \(L\) 的单调递增变换通常也保持极值位置一致。该性质解释了为什么对数似然在推断中普遍使用。
2.5 平滑性、可导性与正则条件(概览)
为了使用导数进行求解(如得分方程、二阶泰勒展开),通常需要似然在参数空间中具有一定的可导性与光滑性。更进一步,在渐近理论中还常引入“正则条件”,用于保证极限分布、信息量等结论成立。这些条件往往涉及可交换求导与求和/积分、参数空间边界处理以及矩存在性等。
3 对数似然与推断工具
对数似然把乘积结构转化为加和结构,使得优化、数值计算与理论推导更为方便。
3.1 为什么使用对数似然
当样本量较大时,直接计算乘积形式的似然可能造成数值下溢;而对数把乘积变为求和,数值稳定性更好。理论上,对数形式也更容易求导并得到相应的条件方程。
3.2 得分函数与一阶条件
对数似然关于参数的梯度称为得分函数。对独立同分布样本,得分通常可以写成各样本贡献的求和。求极值时,一阶条件表现为 \[ \nabla_\theta \ell(\theta)=0 \] (或在约束情形下对应拉格朗日乘子或广义一阶条件)。解该方程往往给出最大似然估计的候选值。
3.3 二阶导数、曲率与信息量(概览)
二阶导数(海森矩阵)刻画对数似然在参数空间的曲率。通常在极大值附近,曲率为负(或海森矩阵为负定/半负定)。在渐近理论中,还常使用期望曲率与“Fisher 信息”联系,以得到估计量方差的近似表达与置信区间构造的理论基础。
3.4 一致性与渐近近似(概览)
在常规条件下,最大似然估计及基于对数似然的估计过程可表现出一致性(样本量增大时估计趋向真实参数)以及渐近正态性。其结果通常依赖于模型的可识别性、正则性以及信息量的存在。这里的关键思想是:对数似然在大样本下可用二阶近似刻画,从而得到近似推断。
4 与估计方法的关系
似然函数不仅是某个算法的一部分,更是把“估计目标”编码成优化问题的通用语言。
4.1 最大似然估计(MLE)
最大似然估计寻找使似然最大(或对数似然最大)的参数值: \[ \hat{\theta}_{\text{MLE}}=\arg\max_\theta L(\theta)=\arg\max_\theta \ell(\theta). \] 在很多模型中,这个目标函数的形状由似然决定,因此也决定了数值求解的难易程度与解的多样性。
4.2 估计量的目标函数视角
从目标函数角度看,MLE把“参数选择”变成一个纯粹的优化问题:在参数空间中比较每个参数对观测数据的解释强弱。 当模型满足某些结构时,似然最大化可能等价于更熟悉的损失最小化(例如线性回归与最小二乘之间的联系将在后文概览)。
4.3 与极大化对数似然的等价性
由于对数是单调变换,最大化 \(L(\theta)\) 与最大化 \(\ell(\theta)\) 在最优点上等价。实践中对数形式更适合用于求导与数值稳定计算,因此在推导和工程实现中更常出现。
4.4 EM 算法中的似然思想(概览)
EM(期望最大化)常用于含有隐变量或不完整数据的模型。其基本思想是:在迭代过程中交替进行“期望步骤”(根据当前参数计算某种后验期望)与“最大化步骤”(在该期望下更新参数),从而使目标函数(与对数似然相关的量)单调改进。EM并不总是直接最大化原始似然,但它与似然优化之间存在紧密的理论联系。
5 与贝叶斯推断的关系
贝叶斯框架把不确定性显式地分配给参数:先验提供“参数可能取值的分布”,似然刻画数据对这些可能性的修正。
5.1 似然在后验中的作用
贝叶斯定理给出后验分布与似然的关系: \[ p(\theta\mid x)=\frac{p(x\mid \theta)p(\theta)}{p(x)}. \] 在该结构中,似然 \(p(x\mid \theta)\) 作为与参数相关的因子,与先验相乘形成后验的未归一化形状。
5.2 先验—似然—后验的乘积结构
从未归一化角度,后验与“先验乘以似然”成正比: \[ p(\theta\mid x)\propto p(x\mid \theta)p(\theta). \] 这使得似然的作用清晰:当某个参数取值使数据更“合理”(似然更大),其在后验中的权重会随之上升,同时也会受到先验分布的限制。
5.3 证据/边缘似然的用途(概览)
边缘似然(也称证据)为 \[ p(x)=\int p(x\mid \theta)p(\theta)\,d\theta\quad\text{或}\quad \sum_\theta p(x\mid\theta)p(\theta). \] 它用于归一化后验,也可用于模型比较:不同模型的边缘似然反映了在考虑参数不确定性后,数据在该模型下整体上“有多支持”。
6 模型比较与检验中的似然
似然不仅用于估计,也用于评估模型相对好坏与检验统计思想。
6.1 似然比检验概念(概览)
似然比检验比较两种模型(或两类假设):一个约束更强、另一个更自由。典型统计量基于两者最大似然之比构造。直观上,若在自由模型下对数据的解释显著更强,则约束假设可能不被支持。相关的渐近分布常与卡方分布联系(在常见正则条件下)。
6.2 信息准则思想(概览)
信息准则(如 AIC、BIC)利用对数似然(在最大化处取值)来度量拟合优度,并加入对参数复杂度的惩罚,从而在“拟合得更好”和“模型不至于过度灵活”之间折中。其共同点是把似然作为拟合度量的核心来源。
6.3 过拟合与似然尺度问题(概览)
在参数复杂度上升时,最大化似然可能导致模型过于贴合训练数据,从而产生过拟合。即便如此,似然的数值尺度也可能受到样本量、单位变换等因素影响,因此在比较模型或阐释数值大小时通常更依赖相对量(如对数差、比值)或经过惩罚/标准化的准则。
7 计算与工程实现
数值实现时需要处理下溢、约束与优化策略等工程问题。对数似然在这里尤其常用。
7.1 数值稳定性:下溢与对数域计算
当 \(L(\theta)\) 为许多小概率的乘积时,直接计算可能迅速趋近于 0。工程上常在对数域中计算: \[ \log L(\theta)=\sum_i \log p(x_i\mid\theta). \] 若还涉及“概率相加的对数”(例如某些边缘化近似),则需要更稳健的“log-sum-exp”技巧以避免精度损失。
7.2 梯度法与数值优化(概览)
在可导模型中,常用梯度或准牛顿法求解最大化对数似然的问题。梯度信息来源于得分函数,而曲率信息可来自二阶导数或其近似。优化过程中也要注意初始值选择、局部极值以及参数空间边界导致的不稳定。
7.3 约束参数与惩罚似然(概览)
当参数必须满足非负性、单调性或范数约束等条件时,可以通过约束优化或参数重参数化来实现。与此同时,为了抑制过拟合或提高数值稳定性,常引入惩罚项形成“惩罚似然”或“正则化对数似然”,在目标中加入对参数大小或复杂度的约束性偏好。
7.4 近似推断中的似然替代(概览)
在复杂模型中,精确后验或证据可能难以计算。此时常见做法是使用近似推断方法(如变分思想、马尔可夫链蒙特卡洛或拉普拉斯近似)来替代精确计算。无论采用哪种近似,似然仍通常作为核心输入(例如用于构造目标函数或提取局部形状信息)。
8 常见例子与应用场景
本节给出几类经典分布的似然形式,展示如何从概率模型直接写出对数似然或用于优化的目标函数。
8.1 正态分布的似然形式
若 \(X\sim \mathcal{N}(\mu,\sigma^2)\),观测值为 \(x_1,\dots,x_n\) 且独立同分布,则 \[ L(\mu,\sigma^2)=\prod_{i=1}^n \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x_i-\mu)^2}{2\sigma^2}\right). \] 对数似然为其对数形式,通常可简化为“平方误差项的和”与常数项之差。最大化对数似然会得到常见的参数估计结果。
8.2 二项分布与伯努利分布的似然形式
伯努利分布用于单次试验:若 \(Y\in\{0,1\}\),且 \(P(Y=1)=p\),则 \[ L(p)=\prod_{i=1}^n p^{y_i}(1-p)^{1-y_i}. \] 二项分布通常描述 \(n\) 次试验中成功次数 \(k\): \[ P(K=k\mid p)=\binom{n}{k}p^k(1-p)^{n-k}. \] 在这两类模型中,似然对参数的依赖主要体现在 \(p\) 的幂次上,因此对数形式往往直接对应“计数统计量”的线性组合。
8.3 泊松分布的似然形式
若计数数据 \(X_i\) 服从 \(\text{Poisson}(\lambda)\),则单个样本的概率为 \[ P(X_i=x_i\mid\lambda)=e^{-\lambda}\frac{\lambda^{x_i}}{x_i!}. \] 独立样本的似然为乘积形式,对数似然可整理为“\(\sum x_i\)”与“样本量乘以 \(\lambda\)”相关的表达,并含有与参数无关的常数项。由此得到对 \(\lambda\) 的估计往往与样本均值密切相关。
8.4 线性回归中的似然与最小二乘联系(概览)
在线性回归模型中,常见设定之一是误差项服从正态分布。此时在高斯噪声假设下,最小二乘与最大似然在目标函数上等价:最大化高斯似然对应最小化残差平方和。该联系说明了“最小二乘并非凭空而来”,而是从似然视角获得的合理优化目标。
8.5 生存/风险模型中的似然思想(概览)
生存分析与风险模型中通常关注“事件发生时间”及其删失信息。此类模型构造似然时会同时考虑未发生事件的删失样本与已发生事件的时间点,常通过条件生存函数或风险函数来表示。尽管具体公式因模型类型而差异较大,但总体思想是一致的:把观测到的时间与删失结构嵌入似然表达式。
9 相关概念与术语
似然常与若干经典概念相互关联,帮助理解其统计意义与信息论背景。
9.1 边缘似然、条件似然
边缘似然通常指对参数或潜变量做积分/求和后的结果,用于归一化后验或模型比较。条件似然则是在特定已知条件或已固定部分下的似然表达,常用于层次模型、缺失数据或隐变量框架中。
9.2 指数族与似然结构(概览)
许多常见分布可归入指数族形式。指数族的结构使得对数似然通常呈现易于求导和推导的参数依赖形式,并与足够统计量相联系。在这种框架下,似然优化常能获得更清晰的理论性质。
9.3 交叉熵与对数似然(联系)
交叉熵是信息论中常用的量。在经验分布或模型分布的对数评价中,对数似然(或其负号)经常出现在交叉熵的表达里,从而把“拟合”理解为让模型在对数意义下更接近真实数据生成机制的过程。此联系使似然优化与最大化预测性能建立桥梁。
9.4 Kullback–Leibler 散度与似然(联系)
Kullback–Leibler(KL)散度衡量两个分布的差异。在很多设置下,最小化 KL 散度与最大化对数似然(在合适的条件和假设下)等价或紧密相关。该关系从信息几何或信息论角度解释了为什么似然最大化能带来统计意义上的“分布接近”。