1 定义与数学形式
差分熵是信息论中对连续随机变量所定义的熵度量,它量化了连续概率分布的不确定性。与离散熵基于概率质量函数求和不同,差分熵以概率密度函数的积分形式呈现。这一定义由香农在其1948年的开创性论文中提出,是离散熵在连续域的自然推广。
1.1 单变量差分熵
设连续随机变量 \( X \) 取值于实数域,其概率密度函数为 \( f(x) \),则 \( X \) 的差分熵定义为:
\[ h(X) = -\int_{-\infty}^{\infty} f(x) \log f(x) \, dx \]
此处对数底数通常取2(单位为比特)或自然常数 \( e \)(单位为奈特)。差分熵又称微分熵或连续熵,它反映了连续分布的平均信息量。与离散熵始终为非负值不同,差分熵的值域覆盖全部实数——它可以取负值,例如当分布非常集中时。
1.1.1 概率密度函数必要条件
差分熵存在的必要条件是:概率密度函数 \( f(x) \) 必须定义良好且可积,即满足 \( f(x) \geq 0 \) 且 \( \int f(x) dx = 1 \)。此外,积分 \( -\int f(x) \log f(x) dx \) 必须为有限值。这要求 \( f(x) \) 在支撑集内不可包含狄拉克δ函数等奇异成分,且尾部衰减速度需足够快,以使对数项的可积性得到保证。实际应用中,大多数常见连续分布(如高斯分布、均匀分布)均满足这些条件。
1.2 多变量差分熵
当随机变量扩展至多维时,差分熵的定义自然推广到向量形式。多变量差分熵用于刻画多个连续随机变量共同携带的不确定性。
1.2.1 联合差分熵
设随机向量 \( \mathbf{X} = (X_1, X_2, \ldots, X_n) \) 的联合概率密度函数为 \( f(\mathbf{x}) \),则其联合差分熵定义为:
\[ h(\mathbf{X}) = -\int f(\mathbf{x}) \log f(\mathbf{x}) \, d\mathbf{x} \]
积分区域为整个 \( n \) 维欧几里得空间 \( \mathbb{R}^n \)。联合差分熵度量了整个向量系统的不确定性总量,是单变量差分熵的直接推广。
1.2.2 条件差分熵
给定连续随机变量 \( Y \),随机变量 \( X \) 的条件差分熵定义为:
\[
| h(X | Y) = -\int f(x,y) \log f(x | y) \, dx\,dy |
|---|
\]
| 其中 \( f(x | y) \) 为条件概率密度。条件差分熵反映了在已知 \( Y \) 的前提下,\( X \) 所保留的剩余不确定性。根据链式法则,联合差分熵与条件差分熵满足 \( h(X,Y) = h(X) + h(Y | X) = h(Y) + h(X | Y) \),这一关系与离散熵的对应性质完全平行。 |
|---|
2 基本性质
2.1 可加性
差分熵具有可加性,但仅针对独立随机变量。如果 \( X_1, X_2, \ldots, X_n \) 相互独立,则有:
\[ h(X_1, X_2, \ldots, X_n) = \sum_{i=1}^n h(X_i) \]
对于一般情形,联合差分熵不大于各单独差分熵之和,等号成立当且仅当各变量相互独立。此性质源于对数函数的凸性,反映了变量之间相关性会降低总的不确定性。
2.2 变换不变性
差分熵对随机变量的变换具有不确定性,是其在信息度量中的一个重要特征。离散熵对变量的一一映射保持严格不变,而差分熵在连续变换下会改变。
2.2.1 线性变换下的缩放关系
设 \( Y = aX + b \),其中 \( a \neq 0 \),则差分熵的变换公式为:
\[
| h(Y) = h(X) + \log | a |
|---|
\]
| 这表明线性缩放会导致差分熵按缩放因子的对数增减。若 \( | a | < 1 \),分布更集中,熵减小;若 \( | a | > 1 \),分布更分散,熵增大。平移因子 \( b \) 不影响熵值。对于多维情形,若 \( \mathbf{Y} = A\mathbf{X} + \mathbf{b} \),其中 \( A \) 为可逆矩阵,则有: |
|---|
\[
| h(\mathbf{Y}) = h(\mathbf{X}) + \log | \det(A) |
|---|
\]
2.2.2 可逆非线性变换的雅可比修正
对于可逆非线性变换 \( Y = g(X) \),其中 \( g \) 为严格单调且可微函数,差分熵变换为:
\[
| h(Y) = h(X) - \mathbb{E} \left[ \log \left | \frac{dg^{-1}(Y)}{dY} \right | \right] = h(X) + \mathbb{E} \left[ \log \left | g'(X) \right | \right] |
|---|
\]
多维情形下,若 \( \mathbf{Y} = \mathbf{g}(\mathbf{X}) \) 为可逆映射,则雅可比行列式修正项出现:
\[
| h(\mathbf{Y}) = h(\mathbf{X}) + \mathbb{E} \left[ \log \left | \det \left( \frac{\partial \mathbf{g}}{\partial \mathbf{X}} \right) \right | \right] |
|---|
\]
这一性质在变量代换和信息几何中扮演核心角色,是连续分布信息度量与离散情形最显著的区别之一。
2.3 与离散熵的极限关系
差分熵可视为离散熵在连续极限下的近似,但二者之间存在本质差别。
2.3.1 量化逼近的熵差
对连续随机变量进行均匀量化,量化为离散值,即设每个量化区间宽度为 \( \Delta \),则离散近似熵与连续差分熵之间满足:
\[ H(X_\Delta) \approx h(X) - \log \Delta \]
其中 \( X_\Delta \) 为量化后的离散变量。这一关系表明,差分熵大致等于离散熵减去与量化粒度相关的常数项。在实际应用中,当 \( \Delta \) 很小时,该近似精度较高。
2.3.2 随粒度极限的无穷大发散
当量化粒度趋于零,即 \( \Delta \to 0 \) 时,离散熵 \( H(X_\Delta) \to \infty \)(因为离散状态数趋于无穷)。这表明使用有限精度的离散表示来描述连续分布,其信息量理论上发散。差分熵通过减去 \( -\log \Delta \) 项来移除这种发散,从而获得一个有限且依赖于分布形态的度量。从这一角度看,差分熵可被解释为离散熵的“有限部分”,但其绝对值依赖于坐标系的选取。
3 常见分布的差分熵
3.1 均匀分布
连续随机变量 \( X \) 在区间 \( [a, b] \) 上服从均匀分布,其概率密度为 \( f(x) = 1/(b-a) \),则差分熵为:
\[ h(X) = \log(b-a) \]
若以2为底,单位为比特,公式为 \( \log_2(b-a) \)。均匀分布的差分熵随区间长度增大而增加,且严格为正值当且仅当区间长度大于1。当 \( b-a < 1 \) 时,熵为负,表明分布集中在较小区域内,不确定性低于单位宽度均匀分布。
对于 \( n \) 维超立方体 \( [a_1, b_1] \times \cdots \times [a_n, b_n] \) 上的均匀分布,联合差分熵为:
\[ h(X) = \sum_{i=1}^n \log(b_i - a_i) \]
即各维对数长度之和。
3.2 高斯分布
高斯分布(正态分布)是信息论中最重要的分布之一,其在给定二阶矩条件下具有最大熵。
3.2.1 一维高斯差分熵公式
设 \( X \sim \mathcal{N}(\mu, \sigma^2) \),则其差分熵为:
\[ h(X) = \frac{1}{2} \log(2\pi e \sigma^2) \]
以2为底时,写为 \( \frac{1}{2} \log_2(2\pi e \sigma^2) \) 比特。值得注意,熵值与均值 \( \mu \) 无关,仅取决于方差 \( \sigma^2 \)。随着方差增大,分布更分散,熵值随之增加。
3.2.2 多维高斯差分熵
设随机向量 \( \mathbf{X} \sim \mathcal{N}(\boldsymbol{\mu}, \Sigma) \),其中 \( \Sigma \) 为 \( n \times n \) 正定协方差矩阵,则联合差分熵为:
\[ h(\mathbf{X}) = \frac{1}{2} \log \left( (2\pi e)^n \det(\Sigma) \right) \]
若使用自然对数,则 \( h(\mathbf{X}) = \frac{n}{2} \log(2\pi e) + \frac{1}{2} \log \det(\Sigma) \)。这一公式表明,多维高斯熵由维数和协方差矩阵的行列式共同决定。当各分量独立时,\( \Sigma \) 为对角阵,\( \det(\Sigma) \) 退化为各分量方差之积,熵即可分解为各维度熵之和。
3.3 指数分布与拉普拉斯分布
指数分布通常用于建模等待时间或寿命数据,其概率密度为 \( f(x) = \lambda e^{-\lambda x} \)(\( x \geq 0 \))。差分熵为:
\[ h(X) = 1 - \log \lambda \]
以2为底时,写为 \( \log_2(e/\lambda) \) 比特。参数 \( \lambda > 0 \) 为速率参数,熵随 \( \lambda \) 增大(即分布更集中)而减小。
| 拉普拉斯分布(双指数分布)的概率密度为 \( f(x) = \frac{1}{2b} e^{- | x-\mu | /b} \),其差分熵为: |
|---|
\[ h(X) = 1 + \log(2b) \]
以自然对数为底时,形式更简洁。拉普拉斯分布常被用于信号处理和稀疏建模,因其具有更重的尾部而比高斯分布对异常值更鲁棒。
3.4 柯西分布与重尾分布
柯西分布的概率密度为 \( f(x) = \frac{1}{\pi} \frac{\gamma}{(x - x_0)^2 + \gamma^2} \),其中 \( \gamma > 0 \) 为尺度参数。柯西分布的差分熵可通过积分求得:
\[ h(X) = \log(4\pi\gamma) \]
以自然对数为底时成立。柯西分布是一个典型的重尾分布,其方差无穷大,但差分熵仍有定义且为有限值。重尾分布的差分熵通常大于同尺度下的轻尾分布(如高斯分布),因为其不确定性更大。但需注意,由于柯西分布的一阶矩也不存在,在信息论应用中通常需要谨慎处理。
4 极值性质与最大熵原理
最大熵原理指出:在给定约束条件(如固定矩或支撑集)下,所有满足约束的概率分布中,使差分熵达到最大的分布是最“无偏”或“信息量最少”的分布。这一原理源于直觉:在没有额外信息时,我们应选择不确定性最大的分布。
4.1 给定方差下的最大熵分布
当约束条件仅涉及随机变量的均值和方差时,最大熵分布具有显式形式。
4.1.1 高斯分布的最优性
在所有均值为 \( \mu \)、方差为 \( \sigma^2 \) 的连续分布中,高斯分布 \( \mathcal{N}(\mu, \sigma^2) \) 的差分熵最大。这一结论可通过变分法证明:构造拉格朗日函数,在概率密度归一化、固定均值和方差三个约束下,最大化熵,解得分布的形式恰好是高斯密度。高斯分布的最大熵值即 \( \frac{1}{2} \log(2\pi e \sigma^2) \),任何其他同方差的分布(如拉普拉斯分布、均匀分布)的熵都小于此值。
这一事实解释了高斯分布为何在自然界和工程问题中如此普遍:当仅有均值和方差信息时,它是最“随机”或最“不确定”的选择。
4.2 给定支撑集下的最大熵分布
当约束条件只限定分布的支撑集(取值范围),而不涉及矩条件时,最大熵分布表现出另一特征。
4.2.1 均匀分布与截断分布
若随机变量 \( X \) 的支撑集为有限区间 \( [a, b] \),且无其他约束,则最大熵分布为均匀分布,其熵为 \( \log(b-a) \)。若支撑集为整个实轴且无矩约束,则熵无上界——可以通过使分布无限分散来使熵趋于无穷大,故最大熵分布不存在。
当同时给定支撑集和一阶矩或二阶矩时,最大熵分布为截断指数分布或截断高斯分布。例如,在支撑集 \( [0, \infty) \) 且给定均值时,最大熵分布为指数分布。这些结果在统计力学和机器学习中被广泛用于先验分布的选取。
5 应用场景
5.1 连续信道容量
差分熵是计算连续信道容量(即信道可传递的最大信息速率)的核心工具。
5.1.1 加性高斯白噪声信道
| 考虑加性高斯白噪声(AWGN)信道:输出 \( Y = X + Z \),其中 \( X \) 为输入信号,\( Z \sim \mathcal{N}(0, N_0/2) \) 为高斯噪声,且 \( X \) 与 \( Z \) 独立。信道容量由输入与输出的互信息最大化给出。由于互信息 \( I(X;Y) = h(Y) - h(Y | X) = h(Y) - h(Z) \),而噪声熵 \( h(Z) \) 固定,最大化互信息等价于最大化输出差分熵 \( h(Y) \)。 |
|---|
5.1.2 功率约束下的容量公式
若输入信号受平均功率约束 \( \mathbb{E}[X^2] \leq P \),则当 \( X \) 服从高斯分布 \( \mathcal{N}(0, P) \) 时,输出 \( Y \) 也服从高斯分布 \( \mathcal{N}(0, P + N_0/2) \),此时互信息最大。容量公式为:
\[ C = \frac{1}{2} \log \left( 1 + \frac{P}{N_0/2} \right) \quad \text{(以2为底时单位为比特/通道使用)} \]
此即著名的香农容量公式。差分熵在其中扮演了核心角色:\( h(Y) = \frac{1}{2} \log \left( 2\pi e (P + N_0/2) \right) \),\( h(Z) = \frac{1}{2} \log(\pi e N_0) \),代差即得容量。
5.2 统计推断与学习
在机器学习和统计推断中,差分熵用作连续分布的复杂性或不确定性的度量。
5.2.1 连续分布的熵正则化
在最大似然估计或贝叶斯推断中,对模型参数的先验分布引入熵正则项,可以防止过拟合并鼓励模型输出“平滑”或“分散”的分布。例如,在连续密度估计中,对估计分布的差分熵施加惩罚,有助于避免退化为极端的尖峰分布。正则化后的目标函数形如:
\[ \text{Loss} = -\text{LogLikelihood} - \lambda \cdot h(\hat{f}) \]
其中 \( \lambda > 0 \) 控制熵正则化的强度。
5.2.2 变分自编码器中的熵项
| 变分自编码器(VAE)是一种深度生成模型,其训练目标为证据下界(ELBO)。ELBO 中包含一项对识别网络(编码器)输出的后验分布 \( q(z | x) \) 的熵项: |
|---|
\[
| \mathcal{L} = \mathbb{E}_{q(z | x)} \left[ \log p(x | z) \right] + h(q(z | x)) |
|---|
\]
| 由于 \( q(z | x) \) 通常假设为多元高斯(对角协方差),其熵项可以直接计算(\( h(q) = \frac{d}{2} \log(2\pi e) + \frac{1}{2} \sum_{i} \log \sigma_i^2 \))。这一熵项鼓励后验分布保持分散,从而提升生成的多样性和鲁棒性。 |
|---|
5.3 物理与生物系统
差分熵在物理学和神经科学中也有经典应用。
5.3.1 统计力学中的玻尔兹曼熵
在统计力学中,玻尔兹曼熵公式 \( S = k \ln \Omega \) 与信息熵的关系由来已久。对于连续相空间(位置和动量)中的系统,吉布斯熵定义为:
\[ S = -k \int \rho(\mathbf{x}) \ln \rho(\mathbf{x}) \, d\mathbf{x} \]
其中 \( \rho \) 为相空间概率密度。这一表达式与差分熵完全一致(常数因子 \( k \) 不同)。在微正则系综中,系统在能量面上的均匀分布对应最大熵状态;在正则系综中,给定平均能量下的最大熵分布为玻尔兹曼分布。差分熵在此提供了从信息视角理解统计力学的基础。
5.3.2 神经编码的信息论度量
| 在神经科学中,差分熵用于量化神经元放电序列所携带的信息。神经元的放电率通常建模为连续随机过程,其响应不确定性可用差分熵测量。例如,给定刺激 \( S \),神经元响应 \( R \) 的条件差分熵 \( h(R | S) \) 反映了响应中与刺激无关的噪声成分;互信息 \( I(S;R) = h(R) - h(R | S) \) 则衡量了神经元编码刺激的信息量。这一框架帮助研究者理解感觉系统的编码效率和信息传递极限,在听觉、视觉和体感系统的实验中均有应用。 |
|---|