1 基本概念
1.1 定义
1.1.1 离散随机变量与取值集合
离散随机变量是指其可能结果可以逐一列举的随机变量,这些结果通常构成有限集或可数无限集。与连续型随机变量不同,离散型变量的概率集中分配在一个个具体取值上,因此可以直接讨论“取某个值”的概率。
1.1.2 概率质量函数的形式化定义
概率质量函数是描述离散随机变量分布的一种函数,通常记为 \(p(x)\) 或 \(P(X=x)\)。若随机变量 \(X\) 取值于集合 \(S\),则对任意 \(x \in S\),有 \[ p(x)=P(X=x), \] 并且在集合外通常定义为 0。该函数完整刻画了离散随机变量在各取值上的概率分配。
1.2 适用对象
1.2.1 有限取值随机变量
对于只可能取有限多个值的随机变量,概率质量函数最为直观。例如掷一次硬币得到“正面”或“反面”,或一次抽取中判断“成功”与“失败”,都可以用 PMF 精确描述。
1.2.2 可数无限取值随机变量
某些随机变量的取值虽然不止有限个,但仍可按顺序一一列出,如非负整数上的计数型变量。此类变量同样适用概率质量函数,只是概率需要在无限多个点上分配,并满足总和为 1。
1.3 与其他概率函数的区别
1.3.1 与概率密度函数的区别
概率质量函数针对离散变量,描述单点概率;概率密度函数则用于连续变量,单点处的“密度”不等于该点概率。连续型随机变量在单个点上的概率通常为 0,而离散型随机变量可以在某一点上有正概率。
1.3.2 与累积分布函数的区别
累积分布函数给出随机变量取值不大于某一阈值的累计概率,形式上适用于所有类型随机变量。PMF 则关注每个离散点的概率分配,二者关系紧密,但表达重点不同:前者强调累积,后者强调单点。
2 数学性质
2.1 非负性
2.1.1 各点概率不小于零
概率质量函数在每个取值上的函数值都不能为负,即 \(p(x)\ge 0\)。这是概率的基本要求,反映了事件概率作为度量的非负性质。
2.2 归一性
2.2.1 所有取值概率之和等于 1
若 \(X\) 的全部可能取值为 \(x_1,x_2,\dots\),则 \[ \sum_i p(x_i)=1. \] 这表示随机变量必定会落在其支持范围内的某个取值上,因此全部可能结果的概率总和必须为 1。
2.3 支持集
2.3.1 非零概率对应的取值范围
支持集是指概率质量函数不为 0 的那些取值所组成的集合。它反映了随机变量真正可能出现、且具有实际概率质量的范围。在实际分析中,支持集常用于判断分布的结构与边界。
2.4 可加性与事件概率计算
2.4.1 由单点概率求区间概率
对于离散型随机变量,某个事件若由若干离散取值构成,则该事件概率可由对应单点概率相加得到。例如,若 \(A=\{X\in T\}\),则 \[ P(A)=\sum_{x\in T} p(x). \] 这使得区间概率或集合概率可以通过有限或可数求和直接计算。
3 常见离散分布的概率质量函数
3.1 伯努利分布
3.1.1 单次试验成功与失败
伯努利分布用于描述一次只有两种结果的随机试验,通常记成功概率为 \(p\),失败概率为 \(1-p\)。其 PMF 为 \[ P(X=1)=p,\quad P(X=0)=1-p. \] 它是许多离散分布的基础模型。
3.2 二项分布
3.2.1 多次独立试验中的成功次数
二项分布描述在 \(n\) 次相互独立且成功概率相同的试验中,成功次数的分布。其 PMF 为 \[ P(X=k)=\binom{n}{k}p^k(1-p)^{n-k},\quad k=0,1,\dots,n. \] 该分布常用于统计重复实验中的计数结果。
3.3 几何分布
3.3.1 首次成功所需试验次数
几何分布刻画独立重复试验中,首次出现成功所需的试验次数。若每次成功概率为 \(p\),则其 PMF 常写为 \[ P(X=k)=(1-p)^{k-1}p,\quad k=1,2,\dots \] 它体现了“等待首次成功”的离散随机过程特征。
3.4 泊松分布
3.4.1 固定区间内稀有事件计数
泊松分布用于描述固定时间或空间区间内某类稀有事件发生的次数。若平均发生率为 \(\lambda\),则 \[ P(X=k)=\frac{e^{-\lambda}\lambda^k}{k!},\quad k=0,1,2,\dots \] 该分布在排队、到达过程和计数建模中应用广泛。
3.5 超几何分布
3.5.1 不放回抽样模型
超几何分布描述从有限总体中不放回抽取样本时,某类对象被抽中的次数。其 PMF 由总体规模、成功个数和样本容量共同决定,适用于有限库存、抽样检验等场景。
4 表达与表示方法
4.1 表格表示
4.1.1 离散取值与对应概率列表
概率质量函数常以表格形式列出每个取值及其对应概率。这种表示方式清晰直观,便于查看支持集、比较不同取值的概率大小,也便于手工计算累计概率。
4.2 图形表示
4.2.1 柱状图与离散概率图
PMF 也常用柱状图或离散点图表示,每个取值对应一根柱子或一个点,柱高表示概率大小。与连续分布图形相比,离散图形更强调“点上的质量”而非连续变化。
4.3 函数表达式
4.3.1 分段形式与参数化形式
不少 PMF 可以写成分段函数,明确指出哪些取值对应非零概率,哪些取值概率为 0。对于伯努利、二项、泊松等分布,则常采用参数化形式,用一个或多个参数统一表达整个分布族。
5 相关统计量
5.1 期望
5.1.1 由 PMF 计算均值
离散随机变量的期望可由 PMF 加权求和得到: \[ E[X]=\sum_x x\,p(x). \] 它表示随机变量在长期重复试验中的平均水平,是分析分布中心位置的基本指标。
5.2 方差
5.2.1 离散分布的离散程度
方差刻画随机变量围绕期望的波动程度,计算式为 \[ \mathrm{Var}(X)=\sum_x (x-E[X])^2p(x). \] 方差越大,说明分布越分散;方差较小,则表示取值更集中。
5.3 高阶矩
5.3.1 偏度与峰度的基础
高阶矩在离散分布分析中用于进一步刻画形状特征,例如偏度反映分布是否左右偏斜,峰度反映尾部厚度与尖峭程度。这些量通常基于 PMF 逐点求和定义。
5.4 累积分布函数
5.4.1 由 PMF 构造 CDF
离散随机变量的累积分布函数可由 PMF 累加得到: \[ F(x)=P(X\le x)=\sum_{t\le x}p(t). \] 因此,PMF 是构造 CDF 的直接基础,两者之间可以相互转换。
6 推导与构造方法
6.1 从实验模型出发
6.1.1 等可能样本空间中的计数
在等可能样本空间中,可以先枚举所有基本结果,再统计某一随机变量对应的取值出现了多少次。取值概率可由“有利结果数/全部结果数”得到,这种方法在初等概率中十分常见。
6.2 由组合计数得到 PMF
6.2.1 排列与组合在概率中的应用
当结果可由组合方式计数时,PMF 往往可通过排列、组合公式推导。例如从 \(n\) 个对象中选出 \(k\) 个的情形,常能直接导出二项分布或超几何分布的概率表达式。
6.3 由条件概率构造
6.3.1 条件下的离散分布
在某些模型中,随机变量的分布需要在给定条件下求得。此时可先确定条件事件,再计算各取值在该条件下的相对概率,从而得到条件概率质量函数。
6.4 由随机变量变换得到
6.4.1 离散映射与新 PMF
若已知随机变量 \(X\) 的 PMF,并令 \(Y=g(X)\) 为某个离散映射,则可通过统计所有满足 \(g(x)=્ય\) 的原值,得到 \(Y\) 的 PMF。该方法常用于变量重编码与分布转换。
7 应用场景
7.1 统计建模
7.1.1 离散数据的分布拟合
在统计建模中,PMF 常用于拟合计数数据、类别结果或成功次数等离散观测。通过选择合适的分布族并估计参数,可以较好描述实际数据的概率结构。
7.2 计算机科学
7.2.1 算法分析与随机过程建模
在算法性能分析中,PMF 可用于描述随机输入、随机化算法结果或运行步数的分布。它也常用于离散随机过程、马尔可夫链和网络流量模型等问题。
7.3 通信与工程
7.3.1 误码计数与事件计数
在通信系统中,PMF 可用于分析误码个数、丢包次数或重传次数等离散事件。工程领域中,设备故障次数、到达次数和检测结果也经常用离散分布建模。
7.4 数据科学
7.4.1 分类概率与离散预测结果
在数据科学任务中,模型输出常表现为类别概率或离散标签的概率分布。PMF 可用于表示分类结果的置信度,也可作为离散预测与不确定性分析的基础。
8 相关概念与扩展
8.1 概率分布
8.1.1 离散分布与连续分布
概率分布是对随机变量整体概率结构的描述。按变量类型不同,可分为离散分布与连续分布;PMF 是离散分布最核心的表达方式之一。
8.2 概率密度函数
8.2.1 PMF 与 PDF 的对应关系
概率密度函数是连续变量中的对应概念,二者都用于描述分布,但解释方式不同。PMF 给出点概率,PDF 则通过区间积分给出概率,不能直接把某点密度当作该点概率。
8.3 概率母函数
8.3.1 用于生成矩与分析分布
概率母函数通常定义为离散随机变量幂次项的期望形式,可由 PMF 构造而成。它在求矩、处理独立和以及研究某些离散分布性质时很有用。
8.4 特征函数
8.4.1 离散变量的频域表示
特征函数是随机变量分布在频域中的表示形式,对离散变量同样适用。它与 PMF 之间可通过傅里叶变换联系起来,常用于理论分析和分布识别。