1 概述与基本对象

随机变量变换研究在概率空间中,对随机变量施加确定性的函数映射后,新变量所对应的概率性质如何变化。其核心任务是:当变换规则给定时,如何从“变换前”的分布(分布函数、密度或质量函数)系统推出“变换后”的分布,并进一步计算概率、期望、方差统计量

1.1 随机变量与变换的定义框架

设随机变量 \(X\) 定义在概率空间上,取值于某集合(如实数向量空间)。给定确定性函数 \(Y=f(X)\),则 \(Y\) 也是随机变量。变换问题通常从下面两类等式出发:

  1. 事件层面的对应:\(\{Y\in A\}=\{f(X)\in A\}\)
  2. 概率层面的推导:\(P(Y\in A)\) 由 \(P(X\in f^{-1}(A))\) 获得

当分布以 CDF(分布函数)或密度形式给出时,进一步可把上述集合关系转化为可计算的表达式。

1.2 单变量与多变量情形的差异

单变量情形常利用单调性与导数完成“换元”,结构相对直观;多变量情形则需要引入雅可比矩阵,密度变换依赖于映射在局部对体积元素的拉伸与旋转。

此外,多维情形常伴随:

  • 边缘与条件分布的组合使用(从联合分布推出边缘)
  • 可逆性在整体或局部成立的区别
  • 映射的可微性与奇异点带来的特殊处理

1.3 变换前后的“概率描述”:分布函数、密度、质量函数

同一变换可以在不同“概率描述”层面求解:

  • 分布函数层面:通过 \(F_Y(y)=P(Y\le y)\) 推出新 CDF。
  • 密度层面:当随机变量连续且存在密度时,密度可通过“变化率”进行变换。
  • 质量函数层面:离散随机变量可用 \(P(Y=y)=\sum P(X=x)\) 的形式处理(对一一对应与多对一分别讨论)。

三者之间并不互相替代:有些变换用 CDF 更容易,有些用密度更直接;离散情形则回到质量函数与求和机制。

2 单调可逆变换的一般方法

当变换 \(Y=f(X)\) 在取值范围上严格单调且可逆时,新的分布往往可以用较干净的公式得到。直观上,单调可逆意味着“每个 \(y\)”对应“唯一的 \(x\)”,不会出现分支求和或多重覆盖。

2.1 变换与分布函数的对应关系

2.1.1 用分布函数计算新随机变量的分布

设 \(f\) 在 \(X\) 的取值区间上可逆。令 \(x=f^{-1}(y)\),则有 \[ F_Y(y)=P(Y\le y)=P(f(X)\le y) \] 由于单调性,集合 \(\{f(X)\le y\}\) 可与 \(\{X\le f^{-1}(y)\}\) 或 \(\{X\ge f^{-1}(y)\}\) 等价,从而将问题转回已知的 \(F_X\)。

实际推导中需要注意单调方向:

  • 若 \(f\) 严格递增:\(\{f(X)\le y\}=\{X\le f^{-1}(y)\}\)
  • 若 \(f\) 严格递减:\(\{f(X)\le y\}=\{X\ge f^{-1}(y)\}\)

因此,CDF 的推导本质上是“集合不等式随单调函数反向”的对应关系。

2.1.2 处理严格单调性的分段讨论

当 \(f\) 在不同区间上单调方向不同,或在端点处不满足严格性,就需要把定义域切成若干段分别讨论。每一段上都能使用对应的单调规则,再把分段结果拼合成整体的 \(F_Y\)。

这种分段不是形式主义:它对应真实的“阈值映射关系”,决定了在某些 \(y\) 处 CDF 的增长方式。

2.2 密度变换(概率密度函数

2.2.1 一维可导可逆情形

若 \(X\) 具有密度 \(p_X(x)\),且 \(f\) 可导并在相关区间可逆,则 \(Y\) 的密度常以“反函数导数”的形式出现。记 \(x=f^{-1}(y)\),在可逆连续情形下有 \[

p_Y(y)=p_X(x)\left\frac{dx}{dy}\right
=p_X(f^{-1}(y))\left\frac{d}{dy}f^{-1}(y)\right.

\] 等价地,也可写成以 \(dy/dx\) 的形式: \[

p_Y(y)=\frac{p_X(x)}{f'(x)},\quad y=f(x).

\] 绝对值来自单调递增与递减对“拉伸方向”的区分,保证密度非负。

2.2.2 雅可比思想的起点与直观解释

一维情况下,“雅可比”可看作把 \(x\) 的微小变化映射到 \(y\) 的微小变化。若 \(y=f(x)\),则 \(dy\approx f'(x)dx\)。当 \(f'(x)\) 很大时,同样大小的 \(x\) 区间会被拉伸为更大的 \(y\) 区间,密度会相应降低;反之亦然。该“变化率决定密度”的直觉,是多维雅可比矩阵规则的来源。

2.3 期望与矩的变换公式

2.3.1 通过换元积分计算 E[g(Y)]

若可通过反函数将积分变量从 \(y\) 换回 \(x\),则计算期望常见套路是: \[ \mathbb{E}[g(Y)] = \int g(y)\,p_Y(y)\,dy \] 再用 \(y=f(x)\) 和 \(dy=f'(x)dx\)(在一一对应可逆条件下)将其改写为关于 \(x\) 的积分。由于密度变换已内含绝对值,换元时要与可逆分支一致,否则会引入符号错误。

当函数 \(g\) 与变换结构匹配时,积分会显著简化,例如把多项式变换成更易处理的形式。

2.3.2 方差与高阶矩的常用推导套路

方差来自二阶矩: \[ \mathrm{Var}(Y)=\mathbb{E}[Y^2]-(\mathbb{E}[Y])^2. \] 因此常用做法是分别计算 \(\mathbb{E}[Y]\) 与 \(\mathbb{E}[Y^2]\)。更高阶矩同理,通常取 \(g(Y)=Y^k\) 得到 \[ \mathbb{E}[Y^k]=\mathbb{E}[f(X)^k]. \] 若 \(f(X)\) 的形式与已知分布族相容(例如线性、幂次变换),矩的计算更容易落到已知公式或标准积分上。

3 非一一对应与分支情形

当变换 \(Y=f(X)\) 不是一一对应时,单纯用 \(\frac{1}{f'(x)}\) 或单一反函数可能不足。多对一会让多个 \(x\) 共同映射到同一 \(y\),概率“并行贡献”,需要求和。

3.1 多对一变换的基本原则

3.1.1 分支求和:密度的“并行贡献”

若对某个给定 \(y\),存在若干解 \(x_i\) 使得 \(f(x_i)=y\),且在这些分支上可局部可逆,则密度满足 \[

p_Y(y)=\sum_i p_X(x_i)\left\frac{dx_i}{dy}\right
=\sum_i \frac{p_X(x_i)}{f'(x_i)}.

\] 直观上:同一 \(y\) 的取值来自若干“入口”,每个入口对应一段 \(x\) 的概率质量(或密度贡献),最终在 \(y\) 处叠加。

3.1.2 临界点附近的处理要点

当 \(f'(x_i)=0\) 或解发生合并/分裂时,密度公式需要谨慎。常见处理包括:

  • 在临界点附近使用极限或分段分析
  • 检查是否出现“尖峰式”的可积奇异
  • 对于分支数改变的区域,明确临界值对应的区间分割

是否仍能保持密度可积与其衰减速度有关;在实践中往往需要结合具体函数进行局部讨论。

3.2 分段函数变换与不连续点

3.2.1 离散—连续混合的分布拼接

当 \(f\) 具有分段或跳跃结构,\(Y\) 的分布可能同时包含连续部分与离散部分。例如,连续随机变量通过分段映射后,某些 \(y\) 值可能由跳跃段直接“命中”,形成原子概率;其余部分仍通过连续密度贡献形成连续段。

因此应把可逆连续分支的贡献与可能的跳跃点贡献分开计算,再进行拼接。

3.2.2 变换导致的原子概率来源

原子概率常来自以下机制:

  • \(f\) 在某些点把一个非零概率的事件整体映射到同一个 \(y\)
  • 在连续输入下,映射的跳跃使得某些输出值对应的前像集合在概率意义上不过是一条“被整体撞到”的子集
  • 或在原随机变量本身包含离散质量时,变换会把离散点迁移到输出空间形成新的原子

在公式层面,通常表现为:CDF 在某些 \(y\) 处存在跳跃,密度则对应可积连续部分,不会解释跳跃的“额外质量”。

3.3 反变换不可全局进行时的策略

3.3.1 局部可逆与集合分割

如果 \(f\) 只能在局部可逆,那么全局反函数不可用,但局部仍可用。策略是:

  1. 把定义域按可逆区间切分
  2. 对每段求出对应的 \(x_i\) 解与导数贡献
  3. 在输出空间把区间映射后的结果合并

这样能兼顾多分支与不连续边界的影响。

3.3.2 用事件等价重写概率

当密度与反函数不易处理时,回到事件层面的等价更稳健:

  • 利用 \(\{Y\le y\}=\{X\in f^{-1}((-\infty,y])\}\)
  • 把前像集合拆成若干易计数的部分
  • 对每部分使用已知的 \(F_X\) 或密度积分

这种方法通常能避免在解方程与导数符号上出错,但计算可能更依赖集合几何或区间划分。

4 特殊类型的随机变量变换

在常见变换中,一些结构会带来更简洁的公式或更容易的分支划分。下面按变换类型归纳常用处理思路。

4.1 线性变换与平移缩放

4.1.1 均值与方差的直接更新

若 \(Y=aX+b\),则常用结论为:

  • \(\mathbb{E}[Y]=a\mathbb{E}[X]+b\)
  • \(\mathrm{Var}(Y)=a^2\mathrm{Var}(X)\)

当 \(a=0\) 时,\(Y\) 退化为常数随机变量。其余情形可用这些公式快速得到低阶统计量。

4.1.2 分布族的保持性示例

许多分布在仿射变换下保持同一分布族(参数变换但形状不变)。例如在正态情形中,线性变换仍为正态;在某些尺度与位置参数明确的族中同样成立。这类“封闭性”使变换方法在理论推导与建模中非常常见。

4.2 取值变换与幂/绝对值类

4.2.1 |X|、X^2 等对称性带来的简化

当变换涉及绝对值或偶函数,例如 \(Y=X\) 或 \(Y=X^2\),通常利用 \(X\) 在正负两侧的对称或已知分布的性质。对一维密度来说,正负两边往往对应同一输出值,导致“求和叠加”自然出现。

例如,若 \(Y=X^2\) 且 \(X\) 连续,有两个分支 \(x=\pm\sqrt{y}\),因此密度由两项贡献构成。若原分布对称,求和可进一步合并。

4.2.2 单调区间拆分计算密度

幂函数 \(Y=X^k\)(在 \(k\) 为奇数且 \(f\) 全局单调时更简单;偶数时需要分支),常见做法是:

  • 在单调区间上使用可逆密度公式
  • 在符号或临界点把定义域切开
  • 对应输出区间进行拼接

这种拆分能清楚呈现输出的支撑集(例如 \(X^2\ge 0\) 使得 \(Y\) 的取值范围受限)。

4.3 反函数与分布函数迭代

4.3.1 反函数法在 CDF 推导中的应用

在一些变换中,直接求密度困难,但 CDF 易于从不等式关系推导。常见用法是:

  • 对 \(y\) 做出反向不等式对应
  • 借助 \(f^{-1}\) 的区间形式表达前像集合
  • 以 \(F_X\) 的已知形式得到 \(F_Y\)

当 \(f\) 在输出阈值附近改变单调性时,仍需用分段来保持正确性。

4.3.2 分布函数的合成变换

若变换可表达为 \(Y=g(X)\) 且 \(g\) 单调,可将 CDF 直接合成:\(F_Y(y)=F_X(g^{-1}(y))\)(在合适的单调方向下调整不等式)。这种表达强调“分布函数的函数复合”,在参数化推导或数值计算中也很实用。

5 常见例题与分布族对应

本节以“可变换性”为主线,强调如何在常见分布之间建立联系。这里不追求穷尽证明,而给出典型变换链条的使用方式。

5.1 常见可变换分布(如正态相关)

正态相关的变换通常来自线性变换与幂函数组合。线性部分可直接更新均值与方差,若再叠加单调变换,则可在单调可逆框架下得到新的 CDF 或密度。

在实践中,先做仿射标准化(例如把变量转到均值为零、方差为一)往往能减少计算复杂度。

5.2 均匀分布的变换与构造

均匀分布在变换理论中具有“可塑性”:通过单调可逆变换,可以构造许多目标分布。构造类方法常利用分布函数与其反函数之间的关系(与后续“逆变换法”概念相通)。

即使不展开算法细节,也能理解为:均匀变量提供了“基准尺度”,变换把它拉伸成目标的概率密度形状。

5.3 指数、伽马与单调变换的典型链条

指数分布与伽马分布之间常通过幂次或求和结构联系;而幂次变换、指数映射或其组合可通过单调可逆/分支求和建立输出分布。

典型链条的共同点是:变换往往保持输出的支撑集为半无限区间(如 \(y\ge 0\)),并导致密度与原密度相比出现相应的雅可比因子。

5.4 对数变换与乘法结构的拆解

对数变换把乘法结构转化为加法结构:若 \(Y=\log X\),则事件 \(X\le t\) 可对应为 \(Y\le \log t\)。在密度层面,通常会出现 \(1/x\) 形式的比例因子(来自导数或雅可比)。

这种思路在刻画“比例波动”或“对数尺度建模”时尤其常用。

6 多维随机向量变换(概念延展)

多维情形把单变量的“可逆变换 + 导数因子”推广到“映射的体积变换”。关键对象不再是 \(f'(x)\),而是雅可比矩阵。

6.1 联合分布与映射的基本形式

6.1.1 由联合分布导出边缘与条件分布

设随机向量 \(\mathbf{X}\) 取值于 \(\mathbb{R}^n\),给定联合密度 \(p_{\mathbf{X}}(\mathbf{x})\)。若考虑变换 \(\mathbf{Y}=f(\mathbf{X})\),则求 \(\mathbf{Y}\) 的分布通常可先从联合结构出发,并用边缘/条件分布处理部分变量。

当变换只作用于某些分量时,利用条件分布分解常能降低维度计算的复杂度。

6.2 可逆微分变换与雅可比矩阵

6.2.1 多元密度的换元规则

若 \(\mathbf{Y}=f(\mathbf{X})\) 在区域内可逆且可微,则密度变换的核心形式为: \[

p_{\mathbf{Y}}(\mathbf{y})=p_{\mathbf{X}}(f^{-1}(\mathbf{y}))\left\det\left(\frac{\partial f^{-1}}{\partial \mathbf{y}}\right)\right.

\]

等价地也可写为以 \(\det(\partial f/\partial \mathbf{x})\) 表达,并取绝对值。该规则直接对应“一维的 \(dx/dy\)”在多维的推广:行列式刻画局部体积缩放比例。

6.2.2 维度变化与不可微情形的注意

若映射不是同维(例如把二维映射到一维),则不存在简单的“行列式密度公式”。此外,不可微或雅可比行列式为零的点可能导致输出分布出现奇异成分(例如集中在低维子集上)。

在这种情况下,通常需要更一般的测度观点或使用几何前像集合分析,避免把连续密度公式强行套用。

6.3 约束映射、降维与奇异分布(概念层面)

当变换把随机向量限制在某个曲面或低维流形上,输出可能不再拥有关于全空间的普通密度,而更像是“集中在约束集上”的分布。概念层面上,这体现了测度在映射下的非均匀分布:既可能有密度,也可能有奇异部分。

此类情形在理论上更复杂,但对直觉很关键:并非所有映射都会产生与输入维度匹配的“常规连续密度”。

7 计算与应用:从理论到操作

本节聚焦“怎么做”,把前述公式组织成可执行的计算流程,并讨论数值层面的常见坑。

7.1 通过变换推导密度/分布函数的流程

典型流程可以概括为:

  1. 明确变换 \(Y=f(X)\) 的单调性、分支结构与输出支撑集
  2. 判断适用层面:用 CDF 还是密度更省事
  3. 若采用密度:写出可逆分支或用“求和贡献”处理多对一
  4. 若存在跳跃/非连续:检查是否产生原子概率并补上
  5. 最后用边界条件与归一性校验结果(例如积分是否为 1)

这种步骤能降低“公式写对但漏掉分支/跳跃”的概率论错误。

7.2 期望、协方差与相关性的变换

若有多变量变换 \(Y=g(\mathbf{X})\),则协方差通常用 \[ \mathrm{Cov}(Y_1,Y_2)=\mathbb{E}[Y_1Y_2]-\mathbb{E}[Y_1]\mathbb{E}[Y_2] \] 来计算。关键在于能否把 \(\mathbb{E}[g(\mathbf{X})]\) 化成可计算积分或可用已知矩公式的形式。

相关性(如皮尔逊相关)依赖方差与协方差,因而同样受变换后矩的可计算性制约。

7.3 生成随机样本:变换法与逆变换法(概念)

概念上,生成样本的思想是把“已知可采样的随机变量”通过变换映射到目标分布上。逆变换法尤其强调:

  • 先构造均匀变量作为输入
  • 再用目标分布的反分布函数进行映射

在需要处理非严格单调或存在离散成分时,通常要对反函数的取值规则作相应调整,以保证生成结果与目标分布一致。

7.4 仿真中的数值稳定性与边界处理

在数值计算或仿真中,变换可能引发:

  • 临界点处的敏感性(例如导数接近零导致密度公式不稳定)
  • 对数或除法型变换对极小值的放大效应
  • 由于浮点误差导致的“支撑集越界”(例如理论上 \(Y\ge 0\),数值却出现极小负数)

实践中常用的策略包括:对边界作截断与校验、用高精度或替代表达式降低灾难性抵消,以及在分支切换处保持一致的区间划分。

8 直觉与常见误区(轻度“梗”与纠错)

变换题最容易在“看起来差不多”时出错。本节以误区清单的方式提醒如何避坑。

8.1 把“变换后密度=原密度原样代入”这种误区清单

一个常见的“梗”是:看到 \(Y=f(X)\) 就把 \(p_Y(y)\) 直接写成 \(p_X(y)\)。这通常错误,因为密度不是简单替换变量名,而是要考虑映射对区间体积的改变,必须引入导数或雅可比因子。

只有在变换对尺度保持不变(例如平移且无缩放,或在特定约束下导数因子等于 1)时,才可能出现“接近等价”的情形。

8.2 忽略单调性/分支导致的错误(“看起来差不多”)

当 \(f\) 非一一对应,或者单调方向改变,若忽略分支求和,就会少算概率质量。输出分布可能仍“像真的”(例如仍非负、形状相似),但归一性会出问题或在某些区间系统偏小。

因此在推导密度时,先数清“对每个 \(y\) 有几个解 \(x\)”是很实用的习惯。

8.3 连续变量边界点的概率为什么可能为零

很多同学会直觉地把“边界点”当成可能的概率质量来源,但在连续模型中,单个点通常对应零概率。分布的“变化发生”在区间上,而不是落在单点本身。

当然,如果变换引入了跳跃或导致离散部分出现,边界点就可能不再是零概率点;这再次提醒要区分“连续密度部分”与“原子概率部分”。

8.4 单位/量纲与雅可比漏掉时的“隐形bug”

如果推导结果的量纲不合理,往往意味着漏了雅可比因子。比如从 \(x\) 到 \(y\) 的尺度单位发生变化,密度作为“每单位长度的概率”应相应调整;只要导数因子缺失,单位往往对不上。

用单位检查来捕捉错误是一种很“工程化”的思维方式,也能帮助在长推导中及时定位问题。