概述与基本定义
伯努利分布(Bernoulli distribution)是概率论中最基础的离散分布之一,用于刻画“只有两种结果”的随机试验。一次试验可能以概率 \(p\) 产生“成功”,以概率 \(1-p\) 产生“失败”。其随机变量常被记作 \(X\),并将成功编码为 1,失败编码为 0。该分布广泛用于硬币抛掷、某事件是否发生的建模,以及二元标签数据的概率描述。
随机试验的“两结果”表述
将随机试验抽象为:每次试验只能落在两个互斥结果之一。若用“成功/失败”的二元标签表示,则伯努利分布给出了这两个结果发生的概率,其中成功的概率为 \(p\),失败的概率为 \(1-p\)。因此,伯努利分布可视为描述单次二元随机事件的规范模型。
伯努利随机变量的取值与参数
伯努利随机变量 \(X\) 只取两个值:
- \(X=1\):表示成功
- \(X=0\):表示失败
其唯一参数通常用 \(p\) 表示成功概率。参数取值应满足 \(p\in[0,1]\),以保证概率在合理范围内。
概率质量函数(PMF)与概率表
伯努利分布的概率质量函数(PMF)可写为 \[ P(X=x)= \begin{cases} p, & x=1,\\ 1-p, & x=0. \end{cases} \] 对应的概率表为:\(P(X=1)=p\),\(P(X=0)=1-p\)。由于 \(X\) 仅有两种取值,整体分布信息完全由参数 \(p\) 决定。
数学性质
伯努利分布的性质高度集中于其低阶矩、生成函数等工具。由于取值仅为 0 与 1,相关计算通常形式简洁,可直接用于后续更复杂分布的推导。
分布的期望与方差
期望为 \[ \mathbb{E}[X]=1\cdot p+0\cdot(1-p)=p. \] 方差可由 \(\mathrm{Var}(X)=\mathbb{E}[X^2]-(\mathbb{E}[X])^2\) 得到。注意到 \(X^2=X\)(因为 \(X\in\{0,1\}\)),因此 \[ \mathbb{E}[X^2]=\mathbb{E}[X]=p, \quad \mathrm{Var}(X)=p-p^2=p(1-p). \]
生成函数与矩的表示
伯努利分布的矩母函数(MGF)为 \[ M_X(t)=\mathbb{E}[e^{tX}]=(1-p)e^{0}+pe^{t}=(1-p)+pe^{t}. \] 由此可用于求任意阶矩:对 \(t\) 求导后在 \(t=0\) 处取值即可得到 \(\mathbb{E}[X^n]\)。在伯努利情形下,由于 \(X^n=X\)(\(n\ge1\)),因此对所有正整数 \(n\),都有 \(\mathbb{E}[X^n]=p\)。
与互补事件的关系
若将“成功”事件记为 \(A\),则 \(X\) 可理解为事件 \(A\) 的指示结果。此时“失败”对应互补事件 \(A^c\)。在概率层面,二者满足 \[ P(X=1)=P(A)=p,\quad P(X=0)=P(A^c)=1-p. \] 这种互补结构也意味着:只要成功概率确定,失败概率自动由 \(1-p\) 给出。
约束条件与参数解释(\(p\in[0,1]\))
由于 \(p\) 表示成功的发生概率,它必须在区间 \([0,1]\) 内。特殊情形包括:
- \(p=0\):成功不发生,\(X\) 恒为 0;
- \(p=1\):成功必发生,\(X\) 恒为 1;
- \(p\in(0,1)\):存在随机性,且期望为 \(p\),波动大小体现在方差 \(p(1-p)\) 上。
计算与常见变体
在实际问题中,经常需要根据模型参数计算概率,并将伯努利分布与条件化、独立性与数据编码方式联系起来。
事件概率的直接计算
若要计算某个结果的概率,直接从 PMF 读取即可。例如:
- 成功概率:\(P(X=1)=p\);
- 失败概率:\(P(X=0)=1-p\)。
由于变量只在两点取值,通常不需要复杂积分或求和。
条件概率与重加权情形(概念层面)
在更一般的场景下,成功概率可能并非固定常数,而是取决于某些条件或观测信息。此时常见建模思路是:令成功概率变为条件概率 \(p(\text{条件})\),并将 \(X\) 理解为在给定条件下服从伯努利分布。进一步的“重加权”概念可用于描述当条件不完全可见或需要校准时的处理方式,但核心仍是:在给定条件后,两种结果的概率之和保持为 1。
多个伯努利变量的独立性讨论
若考虑多个试验,通常会出现多个伯努利随机变量 \(\{X_i\}\)。讨论它们的关系时,关键区分是是否独立:
- 独立情形:每次试验的成功与否互不受其他试验结果影响;
- 非独立情形:成功概率可能受到前后结果或外部因素影响。
独立性假设会显著影响后续合成分布的形式,例如在二项分布推导中扮演基础角色。
与指示变量(indicator variable)的对应
伯努利变量与指示变量在含义上高度一致。给定某个事件 \(A\),定义 \[ I_A= \begin{cases} 1, & A \text{发生}\\ 0, & A \text{未发生} \end{cases} \] 则 \(I_A\) 就是一个伯努利随机变量。其成功概率为 \(P(A)\)。这种对应使得伯努利分布可以自然嵌入到统计建模与估计框架中。
与其他分布的联系
伯努利分布之所以重要,部分原因在于它是多种经典离散分布的基本构件。把“二元结果”视为最底层模块,可以组合出更复杂的随机结构。
二项分布:伯努利试验的多次相加
二项分布可视为独立伯努利试验的成功次数。若进行 \(n\) 次相互独立的试验,每次成功概率为 \(p\),令 \[ S=\sum_{i=1}^{n} X_i, \] 其中每个 \(X_i\) 都服从伯努利分布,则 \(S\) 表示 \(n\) 次试验中成功的总数。二项分布描述的就是 \(S\) 的分布。
几何分布:首次成功的等待时间
几何分布与“在独立试验中首次成功出现的时刻”相关。直观上,把“每次都是伯努利试验”作为基础,当持续出现失败直到第一次成功时,所等待的试验次数就对应几何分布。其建模核心仍然依赖单次成功概率为 \(p\) 的伯努利结构。
负二项分布:成功次数驱动
负二项分布常用于刻画“在若干次成功之前会经历多少次试验”。在该框架下,可以把每次试验视为伯努利过程,变量关心的是达到第 \(r\) 次成功所需的试验总数。与几何分布相比,负二项分布将“首次成功”推广为“达到指定成功次数”。
马尔可夫/伯努利过程的直观关联(不涉及争议议题)
当伯努利试验被组织成时间序列,并引入状态随时间演化的观点时,可以形成与马尔可夫思想相关的直观连接:每一步的“成功/失败”决定状态的推进方式,从而形成具有转移结构的随机过程。此类关联强调的是“二元事件随时间发生并可追踪”的建模直觉,而具体形式通常需根据过程定义进一步说明。