1 整群抽样的基本概念
1.1 定义与核心思想
整群抽样(cluster sampling)是一种概率抽样方法。它首先将总体按一定规则划分为若干“群”(cluster),随后随机抽取部分群进入样本。对被选中的群,研究者再按照预设规则在群内抽取个体(或对群内进行全查)。其核心思想是:通过先选“群”再选“群内个体”,把抽样从“全体个体层面”转移到“群层面”,从而降低实施成本,并适配总体在空间或组织结构上天然存在的聚集特征。
1.2 与简单随机抽样的对比
简单随机抽样(simple random sampling)要求总体中每个个体具有相同的入样概率,且抽样过程通常在单一层面直接对个体进行随机选择。相比之下,整群抽样的随机性发生在群的层面:群被选中后,其内部个体往往更相近(例如同一班级的学习情况、同一机构的管理方式)。这种“群内同质性”会提高抽样结果的相关性,从而影响估计的精度。实践中,整群抽样通过“可操作性”换取“统计精度上的可能损失”,并通常需要更细致的方差与设计效应处理。
1.3 “群(cluster)”的构成方式
群的构成应满足两点:一是群之间尽量不同,二是群内部尽量相似且结构清晰。常见做法包括:
- 自然聚集:如地理邻近的街区、同一医院服务的社区等。
- 组织结构:如学校、班级、工厂车间、社区服务网格等。
- 人为划分:为调查便利而事先划定的单元,例如把道路段划为若干段落或把商圈划为若干片区。
群的边界如果模糊或不稳定,会导致抽样框质量下降,进而增加偏差风险。
1.4 适用场景与常见原因
整群抽样常用于以下情境:
- 个体分布分散:若个体遍布范围广、逐个抽样和访问成本高,先抽群更省时省力。
- 做全体随机抽样成本高:资源有限时,整群抽样能减少外业走访与协调成本。
- 群内更同质:当研究关心的是跨群差异,且群内差异相对较小,整群抽样更符合实际组织或空间结构。
- 抽样框更易获取:在许多调查中,完整的个体名录难以获得,但群单位的清单(如学校名单、机构名单)相对更易获取。
2 抽样流程与实施步骤
2.1 总体分群(构建抽样框)
第一步是明确总体与抽样单位的层次。通常会先确定:
- 总体范围:研究对象的边界条件(时间、地区或人群限定)。
- 群的定义:例如“学校—学生”“社区—居民”“街区—住户”“门店—顾客”等。
- 抽样框:群清单及每个群的基本信息(群规模、位置、可联系渠道等)。
构建抽样框的质量直接影响入样概率计算与后续方差估计的可信度。
2.2 抽取群(一级抽样)
在群层面进行随机选择。常见策略包括简单随机抽取若干群、按概率抽取群(例如与群规模相关的概率比例抽取)或结合分层先在各层内抽取。此阶段要保证每个群有已知且非零的入样概率,以便后续加权。
2.3 群内抽取策略(二级抽样)
当群被选入样本后,对群内个体的抽取存在两类主要做法:
- 全查(complete enumeration):进入样本的群内所有个体都被调查。
- 部分抽取(subsampling):只在群内进一步抽取部分个体,并采用相应的随机规则。
选择全查还是部分抽取,取决于成本、权限、问卷负担与预计的方差结构。全查通常减少群内抽样误差,但可能增加外业工作量。
2.4 现场执行注意事项
现场执行环节常见重点包括:
- 样本名单的可追溯:确保选中的群与群内个体来源明确。
- 访谈或测量的一致性:访员操作规范、测量工具一致,避免把“执行差异”误当成“统计差异”。
- 访问顺序与替代规则:当出现无法联系或拒访时,需要事先规定替代(更换群内个体)是否允许、替代是否影响入样概率。
5 抽样偏差的来源
整群抽样的偏差常见来自:
- 群边界不合理:群内和群间的真实差异结构未被正确反映。
- 抽样框错误或过时:群清单缺失、群规模更新不准确。
- 非响应处理不当:拒访若与目标变量相关且替代规则未按概率逻辑执行,会引入偏差。
- 实施偏离方案:例如在群内“看起来方便就多问一些”,会破坏随机性与入样概率假设。
3 整群抽样类型与变体
3.1 单阶段整群抽样
单阶段整群抽样指只在群层面进行一次抽取,随后在每个选中群内进行调查(全查或部分观测)。
3.1.1 全部观测型
选中群后对群内全部个体进行观测。其优点是简化流程、避免群内再抽样引入的额外随机误差;缺点是外业成本可能较高,且仍会因群内相关性导致方差上升。
3.1.2 部分观测型
选中群后只调查群内部分个体。此设计在成本上更灵活,但需在样本概率计算与方差估计中同时考虑群层面与个体层面的概率结构。
3.2 多阶段整群抽样
多阶段整群抽样在多个层次上逐级抽取群或单元,例如先抽省或地区,再抽城市或机构,最后抽个体。它用于更复杂、层级更深的组织或空间结构。
3.2.1 多级分群与逐级抽取
常见流程为:一级抽取大区域单元,二级抽取其内的更细单元,直至最终个体。每一级的抽取都需要明确入样概率及与分层相关的设计细节。
3.2.2 分层与整群的联合设计
在实际调查中,研究者可能把总体先按某些变量分成若干层(例如城市等级或区域类型),再在每层内采用整群抽样。这样做有助于控制群间差异的来源,并提高估计精度,但会增加方案复杂度。
3.3 自加权与非自加权设计
- 自加权(self-weighting):如果每个最终个体的入样概率在设计下恰好相同或可视为相同,则可不必对个体进行不同权重。
- 非自加权:当不同群规模、抽取概率或多阶段设计导致入样概率不同,通常需要使用加权估计以恢复代表性。
自加权与否常直接影响数据处理复杂度与方差估计方法选择。
3.4 与其他抽样的组合(如系统抽样、概率比例抽样)
整群抽样可以与其他技术结合,例如:
- 系统抽样:在抽取群内个体时使用系统规则,确保操作简洁与近似均匀。
- 概率比例抽样:在群层面按群规模(或其他指标)给予不同抽取概率,以改善对大群与小群的代表性。
组合设计提高灵活性,但要求方案在概率计算与方差公式中保持一致。
4 统计推断与估计
4.1 加权思想与抽样概率
由于整群抽样的入样概率通常随群大小或抽取规则而变化,估计总体特征时常采用加权。直观上,入样概率较小的个体需要更高权重,入样概率较大的个体权重相对较低。权重的构造依赖于每个阶段的入样概率与是否出现非响应或替代。
4.2 点估计的常见做法
点估计常包括:
具体选择取决于研究目标(均值、比例、总量或与协变量相关的分析)。
4.3 区间估计与置信区间构建
在整群设计下,常见区间估计思路仍基于估计量的标准误或方差。然而标准误通常不是简单的“样本方差再除以样本量”,而需要反映群内相关性与抽样结构。置信区间可以基于正态近似、t近似或重抽样技术构建,关键在于方差估计方法与抽样方案相匹配。
4.4 方差估计与设计效应(DEFF)
整群抽样通常会导致估计方差相对简单随机抽样更大,这一差异常用设计效应(design effect, DEFF)来描述。DEFF可理解为:在给定“名义样本量”时,整群设计相当于多少“等效简单随机样本量”。若DEFF>1,说明效率损失需要被样本量规划或精度控制所补偿。方差估计通常会使用考虑抽样层次的公式或稳健方法。
5 样本量规划与精度控制
5.1 聚类效应与ICC(组内相关系数)
聚类效应来自群内个体的相似性。常用指标是组内相关系数(ICC),反映同一群内两名个体的观测值相关程度。ICC越大,群内相关性越强,整群设计导致的方差膨胀通常越明显。样本量规划时需要对ICC或其可替代的先验参数做合理设定。
5.2 有效样本量与“虚胖”问题(设计效应直观理解)
许多人在直觉上会把“总调查人数”当作样本量。但在整群抽样下,群内相似会让“有效信息量”低于“人数”。因此会出现“虚胖”现象:名义样本量增加并不等比例降低标准误,表现为需要更大的群数或更合理的设计来获得同等精度。有效样本量的概念通常与DEFF一起用于解释和沟通结果。
5.3 期望精度与预算约束
样本量设计通常需要同时考虑:
- 目标精度:例如希望置信区间宽度、相对误差、或检验功效达到某水平。
- 预算限制:外业成本往往与“群数”和“单群内调查人数”共同相关。
由于群数对方差的影响往往比群内人数更关键(因为增加群数能削弱群内相关带来的信息损失),在预算受限时应优先权衡“加群”与“加人”的取舍。
5.4 不同类型整群抽样的样本量计算思路
不同类型的计算思路不同,但常见共同点是:把目标指标的方差拆解为“与群相关的部分”和“与群内抽样相关的部分”,再引入ICC与DEFF。单阶段、全查与部分抽取、多阶段与分层都会改变方差结构与权重,从而影响样本量公式的形式与参数需求。实践中也常通过试算、灵敏度分析与历史数据校准来确定最终方案。
6 假设检验与模型框架
6.1 经典检验的适配思路
在整群设计下,如果直接使用忽略群结构的检验(例如把所有个体当作独立同分布),会低估标准误并放大显著性风险。经典检验需要适配抽样结构,至少要采用与抽样设计匹配的方差估计或调整方法。适配的关键在于确保推断所依赖的独立性或方差形式与现实设计一致。
6.2 回归模型中的聚类稳健标准误
当使用回归模型进行解释或控制协变量时,常见做法是采用聚类稳健标准误(cluster-robust standard errors)。它通过允许误差在同一群内相关来调整标准误,从而使推断更稳健。需要注意:聚类稳健标准误的表现与群数多少、群大小分布和模型设定有关。
6.3 分层-整群模型(概念层面)
在理论上,整群设计与分层结构可用层级模型表达,例如把群看作随机效应,个体作为条件层级。这样做有助于同时刻画“群间差异”和“群内变化”。在实践中,模型化方法是否合适取决于研究问题、数据规模以及对模型假设的可接受程度。
6.4 多重抽样误差的处理
在多阶段或含非响应调整的设计中,误差来源并不单一,包括:抽样误差、群内再抽样误差、以及可能的替代或校准带来的额外不确定性。处理思路通常是:在方差估计中显式或隐式地纳入抽样层次,并对权重或替代机制进行一致建模,避免把不同误差来源“混在一起随便用一个公式覆盖”。
7 实践中的质量控制
7.1 统一操作与数据收集规范
质量控制的基础是统一流程:访员培训、问卷指引、测量工具校验、数据录入校验等。对于整群设计,还需要确保同一群内的操作一致性,避免因执行差异造成“群效应”被误解释为统计相关。
7.2 非响应与替代规则(群内/群外)
非响应处理应尽量遵循预先方案。常见选择包括:
- 群内替代:在同一群内用预定义规则更换未完成个体。
- 群外补充:当某些群完成不足时,是否允许增加新的群。
无论采用哪种方式,都应评估其对入样概率与方差估计的影响,以免产生系统偏差。
7.3 抽样框更新与偏差纠正
抽样框在外业期间可能因机构变更、地址变动或名单更新而需要修订。若更新涉及抽样概率的变化,应记录变更原因,并在估计与方差计算中反映调整。可以用校准或事后权重修正来降低偏差,但前提是修正依据透明且与设计一致。
7.4 复核与抽样记录管理(可追溯性)
为保障可复核性,应保留关键记录:群抽取日志、随机种子或抽取依据、权重计算过程、非响应处置与替代清单等。可追溯性不仅有助于审计,也能在发现异常时快速定位问题源头。
8 案例与应用示例(研究方法视角)
8.1 教育研究:班级/学校作为群
在教育场景中,班级或学校自然构成群单位。研究者可先随机抽取学校,再对学校内学生进行调查(全查或抽取部分学生)。整群抽样能减少跨校访问成本,并符合学校组织结构;同时需要处理同班同校导致的回答相关性,通过适当方差估计与权重调整提升推断可信度。
8.2 医疗流行病学:医疗机构/社区作为群
医疗研究常以医疗机构或社区作为群。可先抽取机构,再在机构覆盖的人群中抽样患者或开展随访。由于机构流程、诊疗风格与可及性可能相似,群内相关性较强是常见现象,因此设计效应与ICC的考虑尤其重要。数据分析时也常使用聚类稳健标准误或分层模型思路。
8.3 交通与城市研究:道路段/街区作为群
交通与城市调查常面对空间分散与外业成本高的问题。道路段、街区或交通网格可作为群单元。先抽取若干空间单元再在其中抽样观测点或用户,能降低巡检压力;但边界设置不当会导致样本“落在不该落的区域”,从而引入偏差,因此抽样框维护与现场核验尤为关键。
8.4 市场调研:门店/商圈作为群
市场研究中可把门店或商圈当作群。先抽取商圈,再在商圈内抽取门店或顾客样本。该方法便于控制调研执行成本,并与商业组织实际结构匹配。需要注意的是,门店经营策略差异可能强化群内相关性,使精度下降;同时门店客流波动与非响应会影响权重与替代规则,应在方案中提前规范。
9 常见误区与小结
9.1 群边界不合理导致的偏差
若群的划分与真实相似性来源不一致(例如把本应差异很大的单元放在同一群,或把本应相似的单元拆散),会削弱设计的代表性并增加偏差。群边界应依据可解释的结构(地理、组织、服务关系等)而非仅凭便利。
9.2 误把群当作独立个体
一些分析把整群样本视作简单随机样本,忽略同一群内相关性,导致标准误偏小、显著性判断偏乐观。正确做法通常包括采用与聚类结构一致的方差估计或聚类稳健标准误。
9.3 忽视权重与方差估计
整群抽样经常是非自加权设计,若分析中未使用适当权重,会造成估计偏离总体。与此同时,若方差估计未反映DEFF或抽样层次,置信区间和检验结果也会失真。
9.4 结果呈现时的透明度要求
报告时应清楚说明:群的定义、抽取层次、抽样框来源、入样概率与权重计算方法、非响应处理与方差估计策略。透明度有助于读者理解结果的适用范围,也便于复现与比较不同研究设计。