预注册的概念与目标
1.1 定义与基本要素
预注册(preregistration)是指研究者在开展正式研究之前,将研究的核心承诺以书面或可检索形式提交并存档。通常包含研究假设、主要结局指标、关键分析方案、样本与招募相关的基本规则,以及排除标准与数据处理/缺失数据处理的预先约定。其基本要素强调“先记录、后执行”:研究者把本应在论文撰写时才揭示的关键选择尽量前置到研究启动阶段。
从操作层面看,预注册并非单纯的“写计划书”,而是要能被外部审阅者或同行在时间上追溯,并能作为后续研究过程与结果解释的参照依据。为便于核对,常以研究协议、方案文件或注册表单(结构化字段)实现。
1.2 预注册要解决的偏差类型
预注册主要针对研究流程中常见的偏差来源,尤其是那些会让证据看起来更“符合预期”的做法。其典型目标包括:
- 指标与假设的事后改写:研究在看到数据后才决定主要结局、选择更“好看”的指标或重新定义关键变量。
- 分析路径的选择性报告:在存在多种可行分析方案时,研究者只报告与结果一致的那一条,而隐藏其余选项。
- 排除与处理的结果导向:对异常值、未通过质量控制的数据、或缺失数据的处理规则在事后才变更,从而影响效应估计。
- 多重比较带来的“偶然显著”:如果没有提前约定如何控制检验数量或如何分层/分组,显著发现可能由检验过多产生。
通过把“将做什么”和“如何做”尽早记录,预注册降低了研究者在已经观察到数据之后改变规则的空间。
1.3 与相关概念的区分(如开放数据、分析脚本)
预注册与开放数据、分析脚本等实践有互补关系,但侧重点不同:
- 开放数据:关注研究数据是否可供他人获取与复核,强调可见性与再分析可能性。
- 分析脚本:关注分析流程是否可复用,强调可执行性与计算透明。
- 预注册:关注关键研究决策是否在特定时间点之前被做出并存档,强调时间可追溯与意图一致性。
因此,预注册解决的是“决策是否在事前被承诺”,开放数据与脚本解决的是“证据与计算能否被复核”。三者共同作用时,可重复性与可信度通常更高。
预注册流程
2.1 研究启动前的材料准备
在正式研究启动前,研究者需要梳理研究的关键路径,并把能影响结论的选择尽量具体化。常见准备包括:
- 明确研究目的与假设:写清楚要检验的核心关系或差异。
- 界定变量与测量:包括变量定义、量表得分规则、评分口径等。
- 选择主要与次要结局:说明哪些指标最关键,以及次要指标的定位。
- 规划统计分析:给出模型形式、关键检验方式、协变量/控制变量策略、显著性或置信区间呈现规则等。
- 规定排除与质量控制:例如数据质量门槛、异常处理原则、参与者剔除条件(需与数据收集机制相容)。
- 处理缺失数据与偏离:说明缺失将如何处理、对偏离将如何记录与应对。
准备阶段的核心是“可检验性”:预注册文本应当能指导他人判断研究做了什么、以及是否与既定承诺一致。
2.2 提交与存档(平台与格式概览)
预注册通常通过以下方式提交与存档:
- 研究登记平台:提供结构化字段或文档上传,便于索引与长期保存。
- 学术期刊或会议的预注册通道:有的研究流程与预注册报告形式相结合。
- 机构或项目级别的可追溯文档库:在某些团队环境中,用内部存档与版本控制实现可追溯。
在格式上,既可以采用“表单式结构字段”(便于比较与审阅),也可以采用“方案文件式叙述”(信息更细,但需要注意清晰度与可检验性)。无论哪种形式,关键是提供稳定的记录位置、时间信息与可检索的版本。
2.3 版本管理与时间戳原则
预注册不必要求一次性写到“永远不改”,但必须有可靠的版本管理。常见原则包括:
- 研究启动前的主要版本:通常要求在数据收集开始或关键流程开始前完成,并获得明确时间戳。
- 允许更新但要保留历史:若出现合理需要修订的情形,应在新版本中清楚说明变更内容,并尽可能解释为何修订不会违背核心承诺。
- 重大决策的稳定性:主要结局、主要分析策略等通常应保持相对稳定;若必须变更,应在后续分析阶段做出透明说明与论证。
时间戳与版本号让“事前记录”具备可核对性,也能帮助读者理解偏离的来源。
2.4 实施中的偏离处理与偏差说明
即便事前规划充分,现实研究仍可能发生偏离,例如招募难度变化、测量工具调整、设备故障或假设与操作之间出现不可预见的衔接问题。预注册体系下的关键是:偏离要被记录,并说明其合理性与影响范围。
常见做法包括:
- 偏差分类:区分“预注册之外的实施差异”(说明导致原因)与“对规则的修订”(说明为何修订)。
- 对影响的评估:说明偏离可能如何影响主要结局与结论解释。
- 对分析的处理策略:例如对主要结果仍按原方案处理,或将修订后的分析定位为探索性结果并避免与主要承诺混淆。
这样既保留科研灵活性,也让读者看见研究“到底哪里变了”。
研究设计中的常见预注册内容
3.1 研究问题与假设(含方向性/非方向性)
预注册通常会写明研究问题,并把可检验的假设转化为统计层面的检验目标。假设可以是方向性的(例如“更高/更低”)或非方向性的(例如“存在差异/关联”)。方向性选择会影响检验类型与解释方式,因此应提前写清楚。
此外,研究者还可注明理论依据或推导来源,但重点仍在于“统计上如何检验”。
3.2 变量界定与测量操作化
操作化是将抽象概念变为可测变量的过程。预注册常包含:
- 自变量/自控变量:定义取值、编码规则及如何构造复合指标。
- 因变量/结局:测量工具、评分规则、数据单位、反向计分处理等。
- 协变量:例如年龄、基线指标或质量控制变量的选取与口径。
对量表或行为任务而言,细节尤为重要:例如反应时的截断规则、正确率的定义、数据清理阈值等,都可能显著影响结果。
3.3 主要与次要结局指标(primary/secondary outcomes)
将结局划分为主要与次要,目的是管理解释优先级。主要结局通常与主要假设对应,用于决定研究的核心结论;次要结局更多用于补充与机制探索。
预注册应明确:
- 哪些指标属于主要结局及其理由(与研究问题的对应关系)。
- 次要结局的定位:是探索性还是仍有预先约定的分析重点。
- 如果存在多个主要结局,如何处理优先级与统计控制策略。
3.4 统计分析方案
分析方案部分应尽可能具体,至少包含:
- 模型选择与参数:例如线性/广义线性模型、混合效应结构等。
- 检验方式:t检验、方差分析、回归系数检验、置信区间/显著性阈值等。
- 协变量与控制变量进入规则:固定进入、按规则筛选还是层次化策略。
- 效应量与汇报格式:如标准化效应、预测区间或其他汇报标准。
- 处理异常情况的规则:如极端值替代策略、模型收敛失败时的替代方案。
关键在于让分析“可执行”,而非仅描述“将进行相关分析”。
3.5 样本量与功效分析或其替代策略
预注册常需要交代样本量依据。常见方式包括:
- 基于功效分析确定样本规模:给出预期效应大小、显著性水平与统计功效目标。
- 若功效分析难以直接实施,使用替代策略:如文献先验、试点数据估计、或在资源限制下给出理由与风险控制方式。
需要注意的是,样本量不必保证“绝对充足”,但应解释它如何支撑研究的统计目标。
3.6 排除标准、质量控制与缺失数据策略
预注册在这一部分通常最能体现透明度。常见内容包括:
- 排除标准:例如不通过注意力检查、行为任务失败、测量缺失达到阈值、质量控制未达标等。
- 数据清理规则:异常反应时的截断或剔除边界,重复记录的处理等。
- 缺失数据策略:完整案例分析、单次插补、模型内处理或其他预先说明的方法。
- 处理规则与可重复性:明确记录缺失原因类别(如果可行),说明何时按规则排除、何时保留以避免“选择性删除”。
这些规则应与数据生成机制一致,避免仅因结果变化而调整口径。
预注册在不同研究类型中的应用
4.1 心理与行为研究
心理与行为研究中,预注册常围绕任务操作、被试处理与主要结局展开。典型要素包括反应时清理阈值、准确率与信号检测指标的计算口径、排除条件、以及实验操控与随机化规则。对照组与条件构造方式也通常需写清,避免解释时“以为做的是A,其实做的是B”。
4.2 认知科学与实验范式
认知科学研究常涉及复杂实验流程与多阶段测量。预注册可明确:
- 刺激呈现与条件变量:例如刺激选择范围、呈现时长规则、随机化层级。
- 关键时间窗口与特征提取:例如特征计算基于哪个时段的数据。
- 统计模型:例如对个体差异的层级建模或对多指标的联合分析策略。
在认知范式中,操作化细节对复现影响很大,因此写作时通常需要把“怎么得到指标”说清。
4.3 社会科学的观察研究
观察研究的预注册同样重要,尤其用于约束“事后选择样本或变量”。预注册常强调:
- 样本与纳入排除规则:基于收集过程的规则而非结果导向。
- 关键变量的构造:处理缺失、构造指数或分类变量的规则。
- 统计策略与稳健性检查:主模型与预先约定的替代模型如何对应主要假设。
虽然观察研究难以像实验研究那样控制所有变量,但预注册仍能提高分析透明度与解释可信度。
4.4 流行病学与计量数据场景
在流行病学与计量数据研究中,预注册常面临随访期限、事件定义与删失处理等挑战。预注册可包括:
- 研究对象纳入与随访开始终点定义。
- 结局事件的判定规则与时间窗设定。
- 统计模型:风险回归、比例风险假设检验或其他指定策略。
- 处理缺失与删失:例如删失如何定义、缺失协变量的策略等。
通过提前约定事件与时间规则,可以减少“为了让模型更顺”而变动口径的空间。
4.5 机器学习与建模研究(训练/验证/测试的事先约定)
在机器学习中,预注册常被转化为对数据划分与评估流程的事先约定。典型做法包括:
- 训练/验证/测试划分策略:固定划分还是交叉验证框架的预先选择。
- 特征工程边界:哪些处理仅在训练集上执行,如何避免信息泄漏。
- 超参数选择与调参流程:验证集用于调参的规则,以及何时封存测试集。
- 评估指标与比较方式:例如主指标、次指标及统计比较方法。
这种“工程流程预承诺”有助于减少在看见测试表现后才调整评估口径的问题。
4.6 质性研究与混合方法的对接方式
质性研究的核心不是单一数理检验,因此预注册可采用更合适的形式:强调研究流程的透明与可追溯,而非强行固定每一句编码结果。
常见对接方式包括:
- 研究问题与理论取向:说明关注点与分析框架的起点。
- 采样与访谈/材料收集规则:如何选择参与者、达到饱和与否的标准。
- 编码与主题分析的程序:例如编码如何进行、由谁编码、如何做一致性检查。
- 混合方法的衔接:量化部分的主要指标与分析规则可预先约定;质性部分则通过明确的流程与记录规范提升透明度。
通过把“可验证的流程承诺”前置,质性与混合研究同样能获得预注册带来的透明收益。
平台、文档与可追溯性
5.1 常见预注册平台与用途
预注册平台通常提供存档、索引与可追溯记录。其用途大致包括:
- 作为研究登记入口:研究者提交方案以获得唯一标识。
- 方便审阅与检索:期刊编辑与审稿人可核对是否存在时间先后。
- 促成预注册报告:部分平台与期刊流程或工作流对接。
具体平台各有特点,但目标一致:让“事前记录”可被独立追踪。
5.2 预注册报告(preregistration report)的写作逻辑
预注册报告常见于将分析计划与发表进一步衔接的机制中。其写作逻辑通常是:
- 在数据分析前完成关键写作:把研究问题、方法与分析方案写到可供审阅的程度。
- 审阅聚焦“方法与分析的合理性”:而不仅是结果是否显著。
- 数据收集与分析后再补充结果段落:并报告是否与既定计划一致,偏离在哪里、为何发生。
这种机制强调对承诺与执行一致性的评价,同时降低“只追逐显著性结果”的激励。
5.3 文档结构与可读性规范
良好的预注册文档通常具备清晰结构,便于核对与复现。常见结构要素包括:
- 研究背景与目标:简要说明为何研究与研究问题是什么。
- 方法概览:设计类型、样本来源与关键流程。
- 主要与次要结局:列出指标名称与定义。
- 分析方案:按步骤写清模型、检验、阈值与汇报方式。
- 排除与缺失策略:列出规则与例外处理。
- 偏差与修订记录机制:说明如何记录偏离与版本更新。
可读性不仅影响审阅体验,也影响后续写作与核对是否准确。
5.4 数据与代码的配套开放(脚本、环境与版本)
预注册与开放科学常形成“证据链”。在可行情况下,研究者可在项目实施后配套开放:
- 数据与元数据:说明数据字段含义、单位、缺失标记等。
- 分析脚本:把计算过程可重复化。
- 环境与版本信息:例如依赖库版本、随机种子策略或容器配置。
这样做能把预注册的“计划承诺”与“执行结果”连接起来,让他人更容易检验分析是否遵循既定规则。
方法学评估与实践质量
6.1 预注册“充分性”的判定标准
预注册的质量可从“可核对程度”评估。常见判定维度包括:
- 关键决策是否具体:主要结局与分析方法是否可操作而非模糊描述。
- 风险点是否覆盖:如排除规则、缺失处理、多重比较控制是否被写入。
- 与研究执行是否对齐:预注册所描述的规则能否实际影响研究流程。
- 信息是否可被审阅:文档结构是否让读者能快速定位承诺点。
“充分”并不意味着必须极其冗长,而是要保证关键路径不留过多解释空间。
6.2 偏差说明的透明度与充分性
即使预注册质量较高,偏差仍可能发生。评估偏差说明时常看:
- 是否明确指出偏离发生的位置与时间点。
- 偏离原因是否可解释并与研究现实相符。
- 偏离对主要结局与结论的影响评估是否充分。
- 是否区分了主要分析与探索性补充,避免把后加内容冒充主要承诺。
透明度越高,读者越能理解结果的证据力度。
6.3 可重复性的保障(如分析复现要点)
可重复性不仅依赖预注册,还依赖执行细节。常见保障要点包括:
- 主要分析的可复现参数与模型设定完整披露。
- 随机性控制策略:如随机种子或抽样流程说明。
- 数据处理流程与清理规则一致:与预注册中的口径保持一致。
- 失败处理的策略:如模型收敛失败、特征提取异常时的替代方案。
如果这些要点缺失,预注册可能变成“声明”,而非“可复核的承诺”。
6.4 失败或无效结果的发表与解读
预注册有助于降低“只发布显著结果”的偏差,因此对无效结果的处理更具规范性。其解读通常强调:
- 按主要结局与预先约定的分析进行报告。
- 明确无效结果的统计含义:避免用语言暗示“结果被证明不存在”,而是陈述证据对应的方向与不确定性。
- 对探索性分析保持克制:探索性发现需要被标注为非主要承诺。
这样可以提升对研究“有无支持证据”的理解质量,而不是仅以显著性决定叙事。
常见争议与局限(方法层面、非政治宗教敏感)
7.1 预注册可能带来的研究僵化
一个常见担忧是,过度依赖预注册会让研究流程变得僵硬,降低对意外现象的追问能力。尤其当研究在执行中发现新的测量问题或数据质量线索时,若无法合理修订或记录偏离,研究者可能被迫“硬做下去”,导致方案与实际情境错配。
因此,预注册的关键并不在于“禁止变更”,而在于“变更要可见、可解释,并对结论叙事负责”。
7.2 模型与分析灵活性如何被合理保留
统计建模往往存在多种合理选择,例如不同协变量策略、替代模型或稳健性检验。预注册并不要求把每一处灵活性都消灭,而是要求在合理范围内事先界定:
- 哪些选择属于主流程的一部分,可被预先列为计划内变体。
- 哪些选择属于备选分析,但不应混淆为主要承诺。
- 何时需要在偏差说明中解释为什么必须改变。
通过在文档中建立“计划内替代路径”,可以在透明度与科学探索之间取得平衡。
7.3 小样本、探索性研究与预注册的冲突
小样本与探索性研究可能更依赖数据驱动的发现过程。若把探索完全限制在严格的预注册框架内,研究者可能难以把创新问题转化为预先可检验假设。
一种更可行的做法是:对主要结局与关键检验进行预承诺,同时把探索性环节通过明确标注保留为次级产出;或者采用更适配的预注册报告与版本管理机制,让“探索”仍有合规的表达方式。
7.4 预注册文本的可执行性与细节不足问题
实践中也可能出现“写得很像,但做不了”的情况:文档过于概括,未说明关键参数、缺失规则或数据清理口径,导致事后仍需要补写细节。此类文本会降低预注册价值,因为无法真正核对执行是否遵循计划。
改进方向通常是把最容易导致“选择性偏差”的环节写到足够具体,同时保持必要的抽象层级,不追求冗余而追求可核对。
实务技巧与常见错误
8.1 如何把“计划”写得可检验
把计划写得可检验,通常要做到:
- 用明确的变量定义替代抽象描述:说明如何从原始数据得到分析变量。
- 把主要检验写成可操作步骤:包括模型、检验对象与显著性/置信区间策略。
- 把“何时排除、何时保留”写成规则:避免靠主观判断或模糊术语。
- 说明报告结构:例如主要结局的汇报顺序、效应量与不确定性应如何呈现。
可检验的核心是“他人能核对与复现”,而非“读者能理解你的意图”。
8.2 避免结果导向的指标与分析选择
常见错误包括在看到数据后才决定主要结局、在存在多种测量口径时选择最显著的定义、或在可替代模型间挑选最符合预期的结果。对应的预防措施是:
- 提前列出主要结局的候选指标及其最终选择理由(最终选择应在事前完成)。
- 对可能的替代指标,明确其定位为次要或探索性,并避免与主要结局混淆。
- 在分析方案中预先说明模型比较或稳健性策略的边界。
8.3 缺失数据与排除规则的常见疏漏
一些预注册在缺失数据部分写得过于笼统,或只写“将处理缺失”却不说明方法。常见疏漏包括:
- 未界定缺失阈值与保留规则。
- 未说明插补或替代策略的前提条件。
- 排除标准没有与质量控制流程对齐,导致后来被解释成“为显著性服务”。
改进建议是把缺失与排除规则与数据生成机制相一致,并在偏差说明中保留可追溯记录。
8.4 多重比较与分层分析的提前约定
当研究同时检验多个变量或多个子组,若未提前约定控制方式,显著结果可能被“偶然检出”。常见问题包括未说明家庭误差控制、未区分主次检验、或对子组数量变化的处理没有计划。
预注册中可以通过:
- 明确主要检验与次要检验的层级。
- 预先规定多重比较控制或阈值策略。
- 对分层分析的选择规则进行约束。
来减少事后选择导致的解释偏移。
文化与“梗化”理解(轻度)
9.1 “先写作业再考试”的幽默比喻
在大众语境里,预注册常被类比为“先写作业再考试”:意思是研究者在“考试开始”(数据真正揭示)之前就把作业的答案范围、解题步骤和评分规则先写下,再去参加考试。这个比喻带有夸张幽默感,但抓住了核心:强调时间顺序与规则承诺。
9.2 “不允许事后改答案”的误解与澄清
另一个常见误解是把预注册理解为“完全不允许修改”。更准确的说法是:预注册允许修订与偏离,但需要记录与解释,并避免把偏离后的内容冒充为最初承诺的主要结果。换句话说,“允许调整”不等于“随意改写”,而是把灵活性置于透明规则之内。
9.3 预注册作为开放科学“打卡点”的讨论方式
在开放科学讨论中,预注册常被当作一种“打卡点”:它让研究的关键承诺在公开层面更早出现,帮助同行、审稿人或读者在结果之外看到研究者的意图与计划。以这种方式进行交流时,更容易形成对透明度与复核文化的共识。