1 对数似然的基本定义
1.1 似然函数与概率建模
在统计建模中,通常先给出一个参数化的概率模型,用参数 \(\theta\) 控制分布的形状;随后观测到数据 \(x\)。与“后验概率”不同,似然函数关注的是:在给定参数 \(\theta\) 下,数据 \(x\) 出现的可能性有多大。形式上,似然把参数视为变量,而把观测数据视为常量。
1.2 对数似然的数学表达
设模型的概率(离散情形)或概率密度(连续情形)为 \(p(x\mid \theta)\)。则似然为 \[ L(\theta)=p(x\mid \theta). \] 对数似然定义为 \[ \ell(\theta)=\log L(\theta)=\log p(x\mid \theta). \] 若数据独立同分布,\(x=(x_1,\dots,x_n)\) 且 \(p(x\mid\theta)=\prod_{i=1}^n p(x_i\mid\theta)\),则对数似然可写为求和形式: \[ \ell(\theta)=\sum_{i=1}^n \log p(x_i\mid\theta). \]
1.3 为什么取对数:数值稳定性与计算便利性
概率在数值上常表现为连乘。当样本量较大或单次概率较小,\(\prod p(x_i\mid\theta)\) 可能迅速下溢,导致数值精度损失。对数运算将连乘变为连加,使表达更稳定、也更便于实现。此外,对数函数是单调的,后续最大化/最小化优化时不会改变“最优点的相对顺序”;同时,对数形式通常使导数更简单,便于求梯度与Hessian。
2 对数似然的性质与性质解释
2.1 单调变换与最优解不变性
对数函数在其定义域内严格单调递增,因此对于任何两个参数值 \(\theta_1,\theta_2\),有 \[ L(\theta_1) > L(\theta_2)\quad \Longleftrightarrow\quad \ell(\theta_1)>\ell(\theta_2). \] 因此,“最大似然估计”和“最大对数似然估计”得到的参数相同(在取对数不遇到无效值的前提下)。这也是工程实现中常把优化目标替换为对数似然的核心原因之一。
2.2 凹性/凸性与优化可行性
对数似然关于参数的形状(凹性或凸性)会显著影响优化难度。若在某个参数区域内 \(\ell(\theta)\) 是凹函数,则最大化问题变为相对良性的凸优化子类;反之若呈现多个局部极值,求解可能需要更谨慎的初值与算法策略。即便全局性质不理想,局部曲率信息仍可用于步长控制与二阶近似。
2.3 梯度与Hessian的统计含义
在连续参数模型中,梯度 \[ \nabla_\theta \ell(\theta) \] 对应“参数改变对对数似然的增益方向”。最大值附近,梯度通常趋于零,对应一阶条件(得分方程)。进一步地,Hessian \[ \nabla_\theta^2 \ell(\theta) \] 刻画曲率:若在最大点附近为负定矩阵,说明该点为局部最大;若曲率越陡,表示似然随参数变化衰减更快,进而反映估计的相对确定性更强(在近似条件成立时)。
2.4 期望与Fisher信息的关联
在许多经典模型中,对数似然的期望导数会满足特定性质。例如,常见情形下满足 \[ \mathbb{E}\big[\nabla_\theta \ell(\theta)\big]=0 \] (在正确模型且条件满足时)。此外,Fisher信息可通过多种等价形式表达,例如基于对数似然的二阶导期望或基于得分平方的期望。直观上,Fisher信息越大,意味着数据对参数的“可辨识性”越强,估计误差在局部近似意义下通常更小。
3 常见统计模型中的对数似然
3.1 二项分布与伯努利模型
对于伯努利变量 \(x\in\{0,1\}\),参数为成功概率 \(p\),其概率为 \(p^x(1-p)^{1-x}\)。对数似然为 \[ \ell(p)=x\log p+(1-x)\log(1-p). \] 若有 \(n\) 次独立同分布试验,且令 \(k\) 为成功次数,则二项分布的对数似然(忽略与参数无关的常数项)可写为 \[ \ell(p)=k\log p+(n-k)\log(1-p). \]
3.2 高斯(正态)模型
设观测 \(x_i\) 来自正态分布 \( \mathcal{N}(\mu,\sigma^2)\)。对数似然(完整形式包含常数项)为 \[ \ell(\mu,\sigma^2)= -\frac{n}{2}\log(2\pi\sigma^2)-\frac{1}{2\sigma^2}\sum_{i=1}^n (x_i-\mu)^2. \] 在许多优化场景中,若只关心 \(\mu\) 且方差 \(\sigma^2\) 已知,对应的目标会等价于最小化平方误差(带权或不带权取决于方差是否固定)。
3.3 泊松分布与计数模型
对计数型数据 \(x\in\{0,1,2,\dots\}\),泊松分布参数为 \(\lambda>0\),其概率为 \[ p(x\mid \lambda)=e^{-\lambda}\frac{\lambda^x}{x!}. \] 对数似然为 \[ \ell(\lambda)= -\lambda + x\log \lambda - \log(x!). \] 若有独立样本 \(\{x_i\}\),则总对数似然为对上式求和。优化时常见做法是利用去掉与 \(\lambda\) 无关的项来简化目标。
3.4 其他分布的通用写法与示例
一般而言,若分布为 \(p(x\mid\theta)\),对数似然都可写为 \[ \ell(\theta)=\sum_{i=1}^n \log p(x_i\mid\theta), \] 其中每种分布的具体形式由其概率质量函数或概率密度函数决定。工程上常见的步骤是:先推导 \(\log p\) 的表达式,再对其求导以得到得分方程或用于数值优化。对数形式也使不同模型之间的比较更容易统一到“最大化一个可加的标量目标”框架。
4 最大似然估计中的应用
4.1 MLE的目标函数:最大化对数似然
最大似然估计(MLE)定义为使似然最大化的参数: \[ \hat{\theta}=\arg\max_\theta L(\theta). \] 由于对数是单调变换,等价于 \[ \hat{\theta}=\arg\max_\theta \ell(\theta). \] 当数据为独立样本时,目标函数变为若干项的和,利于分块计算与并行实现。
4.2 一阶条件(得分方程)与解法
在可微情形下,最大点满足一阶条件: \[ \nabla_\theta \ell(\theta)=0. \] 该方程也常被称为得分方程(score equation)。在某些模型里,它能解析解出闭式估计;更多情况下则需要数值求解,例如迭代更新或利用二阶信息加速收敛。
4.3 数值优化方法概览
若对数似然可导且可求梯度,常用方法包括梯度上升/下降(取决于是否把问题转成最小化负对数似然)、牛顿法与拟牛顿法(利用曲率信息或其近似)。当参数维度较高或Hessian难以计算时,常转而使用只依赖梯度的算法。实际实现中还会配合步长策略、正则化项或约束处理以提高稳定性。
4.4 约束参数与拉格朗日乘子
当参数存在约束(例如方差必须为正、概率必须落在区间内),可以使用拉格朗日乘子或对参数进行变量变换。拉格朗日方法将约束并入目标函数,形成新的优化问题;变量变换则常把约束自动满足,例如用对数或logit变换确保参数落在合法域。选择哪种做法取决于约束形式与数值表现。
5 推断与模型比较相关用法
5.1 似然比检验与对数形式
似然比检验基于两个模型或两个假设的似然比。通常做法是比较 \[ \frac{L(\theta_0)}{L(\hat{\theta})} \] 或更一般的受限最大似然与非受限最大似然。由于取对数后乘积与比值运算更稳定,统计量常写成对数形式,例如使用 \[ 2\big(\ell(\hat{\theta})-\ell(\theta_0)\big) \] 作为检验统计量的基础构件。该形式便于推导渐近分布,并能直观反映“更复杂模型带来的对数似然提升幅度”。
5.2 置信区间的近似思想(基于对数似然曲率)
在大样本下,对数似然在估计点附近可用二阶泰勒展开近似: \[ \ell(\theta)\approx \ell(\hat{\theta})-\frac{1}{2}(\theta-\hat{\theta})^\top J(\hat{\theta})(\theta-\hat{\theta}), \] 其中 \(J\) 与Hessian或其期望相关。由此得到的区间估计可理解为:曲率越大,似然下降越快,参数的不确定性越小。尽管这种“局部二次近似”在很多场景有效,但当模型偏离、样本量不足或后验/似然形状明显非二次时,近似精度会下降。
5.3 信息准则:AIC/BIC与对数似然
模型比较常需要在“拟合好坏”和“模型复杂度”之间折中。信息准则将对数似然与参数数量结合,例如AIC与BIC都以最大对数似然为核心项,并加入对复杂度的惩罚。一般而言,模型越复杂往往对数似然提升,但AIC/BIC会对参数过多进行折扣,从而避免纯粹追求拟合导致的过拟合。
6 计算实现与工程注意事项
6.1 对数和指数(log-sum-exp)技巧
在需要计算形如 \(\log\sum_i \exp(a_i)\) 的表达时,直接求和可能因指数过大或过小而溢出/下溢。工程上常使用“log-sum-exp”稳定技巧:通过减去最大值 \(m=\max_i a_i\) 改写为 \[ \log\sum_i e^{a_i} = m+\log\sum_i e^{a_i-m}, \] 从而保持数值稳定。类似思想也常用于计算边缘似然或后验归一化常数的近似。
6.2 处理缺失数据与对数似然
当数据存在缺失,完整数据似然无法直接计算。常见思路包括:对缺失部分进行边缘化(积分或求和),或在特定假设下使用EM算法的期望步骤来优化对数似然相关的下界。无论采用哪种路线,对数形式通常仍是更稳定的选择,因为缺失处理往往涉及多项相加或相乘的组合。
6.3 采样/数值积分下的对数似然估计概念
在贝叶斯推断或复杂模型中,可能需要对似然或后验进行数值积分。若无法解析求解,常用采样方法或变分近似来估计对数边缘似然或与之相关的目标。此时对数似然的估计会受到方差与采样方案影响,因此需要关注误差评估、收敛诊断以及对数尺度下的数值稳定性。
6.4 软件实现常见陷阱与排错思路
常见问题包括:对数中出现零概率导致的 \(-\infty\),以及在归一化或计算比值时发生溢出。排错时可优先检查以下方面:数据与参数是否落在合法域(例如方差是否为正、概率是否非负)、是否错误地把密度当作概率质量函数使用、是否在“去掉常数项”时误删了与参数有关的部分、以及是否使用了正确的独立性假设来组织求和。对数尺度下的debug通常比直接在原始概率尺度更可控。
7 变体与相关概念
7.1 交叉熵、负对数似然(NLL)与训练损失
在机器学习里,常把负对数似然作为损失函数。若模型输出分布 \(p_\theta(y\mid x)\),训练目标通常是最小化 \[ \text{NLL}(\theta)=-\sum_i \log p_\theta(y_i\mid x_i). \] 当经验分布与模型分布的比较方式对应到交叉熵时,NLL与交叉熵之间可视为同一量在特定设定下的不同表达。直观上,NLL惩罚模型对真实标签分配过低概率的情况。
7.2 伪似然与近似推断
当联合似然难以直接计算(例如高维依赖结构复杂),可用伪似然(pseudolikelihood)以降低计算难度。伪似然通常用局部条件分布的乘积或其对数形式替代真实联合分布,从而让优化可行。该方法不等同于精确似然,但在依赖结构的近似假设合理时,仍可获得实用的估计或参数学习结果。
7.3 概率图模型中的对数势函数(log-potential)
概率图模型常通过势函数(或兼容性函数)描述局部相互作用。若势函数为 \(\psi\),则取对数得到的 \(\log \psi\) 常被视为“对数势”。在构建全局对数表达时,许多模型将局部对数势加和到同一标量目标中,并配合归一化项(或在训练中使用可行的近似)。对数形式在这里同样带来计算与梯度的便利。
7.4 对数似然与熵、KL散度的联系
对数似然与信息论量之间存在紧密对应关系。交叉熵与KL散度常用对数形式表达,其中KL散度刻画两个分布之间的“非同一程度”。在某些设定下,最大化对数似然等价于最小化某种与KL散度相关的目标(例如在监督学习中把模型分布逼近数据的经验分布)。因此,对数似然既是统计估计的工具,也可理解为与信息度量相连的一种优化准则。