1 基本概念

异常值处理是指在数据分析过程中,对明显偏离总体分布、且可能影响结论稳定性的观测值进行识别与处置的过程。它既包括发现问题数据,也包括判断这些数据是否应被保留、修正或替换。其核心目的并非一味消除极端值,而是在保留有效信息与控制干扰之间取得平衡。

1.1 异常值的定义

异常值通常指相对于其他观测点显著偏大、偏小,或在多变量关系中表现出异常模式的数据点。它们可能在数值上远离主体分布,也可能在结构上与常见规律不一致。由于“异常”本身带有相对性,同一数据在不同分析任务中可能被赋予不同判断。

1.2 异常值与离群点的区别

异常值与离群点在很多场景中常被混用,但二者侧重点并不完全相同。异常值更强调“需要处理的非典型数据”,其判断往往带有业务或分析目的;离群点则更偏向统计意义上的偏离观测,强调与整体分布或局部邻域的距离。换言之,离群点不一定都要删除,而异常值也不一定只是离群点。

1.3 异常值的来源

异常值的产生原因较为复杂,既可能来自数据生成环节,也可能来自后续采集、传输和整理过程。理解来源有助于选择更合适的处置方式,避免把有意义的信息误当作噪声清除。

1.3.1 测量误差

测量误差是异常值的重要来源之一,常见于传感器漂移、设备校准偏差、环境干扰或观测条件不稳定等情况。此类数据往往并不反映真实对象,而是测量过程中的偏离结果。若误差来源明确,通常可通过修正、剔除或标记方式处理。

1.3.2 数据录入错误

数据录入错误包括手工输入失误、单位填错、编码混乱、字段错位等问题。例如小数点位置错误、将年龄写成出生年份、将不同量纲混在同一列等,都会造成数值突变。这类异常值一般具有明显的人工痕迹,适合通过规则校验与人工复核识别。

1.3.3 真实极端现象

有些异常值并非错误,而是现实中本就存在的极端事件或稀有样本。例如极端天气、罕见消费行为、特殊生理状态或少量高风险个体,都可能形成远离常规分布的数据点。对于这类情况,简单删除可能会丢失关键研究对象,因此需谨慎判断。

1.4 异常值的影响

异常值如果处理不当,可能改变统计量、扭曲模型关系,甚至影响图形判断与业务解释。其影响大小与异常值数量、偏离程度、样本规模以及方法稳健性有关。

1.4.1 对均值与方差的影响

均值对极端值较为敏感,少量大值或小值就可能明显拉动平均水平。方差同样会因极端观测增大而上升,使数据看起来比实际更分散。相比之下,中位数和分位数通常更能抵抗异常值的干扰。

1.4.2 对回归与分类模型的影响

回归分析中,异常值可能拉斜回归线,影响参数估计残差结构,尤其是在最小二乘框架下更为明显。在分类问题中,异常值可能扰乱决策边界,导致模型过拟合个别样本或降低泛化能力。不过,某些鲁棒模型对异常值并不敏感,影响程度会相对较小。

1.4.3 对可视化与分布判断的影响

异常值容易压缩主体数据的展示范围,使大多数样本在图中显得拥挤不清。它们还可能让直方图密度图和箱线图呈现偏态或长尾特征,从而影响对分布形态的判断。因此,在可视化时常需要结合缩放、截断坐标或分层展示。

2 异常值识别方法

异常值识别方法可分为统计学方法、图形化方法、模型驱动方法和多变量检测方法。实际应用中,单一方法往往不足以覆盖所有情况,常需结合多种手段交叉判断。

2.1 统计学方法

统计学方法通常基于数据分布特征或距离规则,适合快速筛查单变量异常点。这类方法实现简单,但对分布假设较为敏感。

2.1.1 Z-score 法

Z-score 法通过计算观测值与均值的标准化距离来判断是否异常。一般来说,绝对值较大的标准分数意味着该点偏离总体较远。该方法适用于近似正态分布的数据,但在偏态或长尾分布下容易出现误判。

2.1.2 IQR 四分位距

IQR 四分位距法依据上下四分位数之间的距离确定异常范围,通常将落在下界以下或上界以上的值视为异常。它不依赖均值和标准差,因此对极端值较稳健,常用于箱线图配套分析。对于偏态数据,该方法通常比 Z-score 更实用。

2.1.3 3σ 原则

3σ 原则认为,若数据近似服从正态分布,则大部分观测应落在均值加减三倍标准差的范围内。超出该范围的点通常会被视作可疑值。该原则直观易用,但前提是分布形态较为规则,否则其判断力会下降。

2.2 图形化方法

图形化方法通过直观展示数据分布、局部结构与变量关系,帮助分析者发现异常模式。此类方法更适合探索性分析,也便于人工复核。

2.2.1 箱线图

箱线图通过中位数、四分位数和须状线展示数据分布,超出须状范围的点通常会被标记为异常候选。它能快速反映离散程度和偏态情况,因而在数据清洗中应用广泛。不过,箱线图对样本量较小或分布非常偏斜的数据也需结合背景解读。

2.2.2 散点图

散点图适合观察两个变量之间的关系,异常值往往表现为远离主群体的孤立点。若加入时间顺序或颜色编码,还可识别趋势变化、簇状结构和局部偏离。对于多变量数据,散点矩阵能提供更全面的初步线索。

2.2.3 直方图与密度图

直方图和密度图可用于观察整体分布形态、尾部延伸和局部峰值。异常值较多时,分布尾部往往会拉长,甚至出现额外小峰。它们适合发现全局层面的偏离,但对单个异常点的定位能力有限。

2.3 模型驱动方法

模型驱动方法以某种统计或机器学习模型为基础,通过残差、簇归属或局部密度等指标识别异常。其优点是可结合数据结构,适用于更复杂的场景。

2.3.1 基于回归残差的识别

在回归模型中,残差明显偏大的样本可能意味着观测异常或模型拟合不足。通过分析标准化残差、杠杆值和影响度,可以筛选对模型拟合产生强影响的点。这种方法适用于关系较明确的结构化数据。

2.3.2 基于聚类的识别

基于聚类的方法先将样本划分为若干簇,再将远离任何簇中心或难以归类的点视作异常候选。若某些样本形成极小簇,也可能提示其特殊性。该方法适合发现局部结构异常,但对聚类参数较敏感。

2.3.3 基于密度的识别

密度方法关注样本周围邻域的稀疏程度,若某点周围样本显著稀少,则可能被判定为异常。局部离群因子等思路即属于此类。相比单纯距离法,密度方法更能适应不同区域的密度差异。

2.4 多变量异常值检测

多变量异常值并不一定在单个变量上异常,但在变量组合关系中表现出不协调。对此,需要从整体协方差结构或低维表示中进行识别。

2.4.1 马氏距离

马氏距离将变量间相关性纳入考虑,用于衡量样本相对于整体中心的多维偏离程度。它比欧氏距离更适合相关变量场景,能更准确反映联合异常。不过,该方法对协方差矩阵估计质量有一定要求。

2.4.2 主成分分析检测

主成分分析检测通过观察样本在主成分空间中的投影位置,识别偏离主要结构的点。若某样本在低维表示中残差较大,可能说明其行为模式特殊。该方法常用于高维数据的异常筛查。

2.4.3 近邻距离法

近邻距离法依据样本与其邻近点之间的距离或局部结构差异判断异常。若某点与周围样本相距较远,便可能被视为异常观测。这种方法实现灵活,但在高维空间中容易受到“距离失效”问题影响。

3 异常值处理策略

异常值处理策略并无统一标准,不同方法对应不同假设与后果。实际应用中,常需在数据质量、研究目的和可解释性之间做权衡。

3.1 删除法

删除法是最直接的处理方式,适合明显错误且无法修复的观测值。它能迅速减轻极端值影响,但也最容易造成信息损失。

3.1.1 整行删除

整行删除是指当某一记录中的关键变量异常时,直接移除整条样本。该方法简单明确,适用于异常范围较大且难以局部修正的情况。不过,若样本本身稀少,整行删除会降低有效样本量。

3.1.2 条件删除

条件删除是根据预设规则,仅删除满足特定异常条件的记录,例如超出生理合理范围、违反业务逻辑或缺失关键字段。它比整行删除更有针对性,可减少误删正常信息的风险。使用时通常需要明确阈值依据与处理标准。

3.2 替换法

替换法用更合理的数值代替异常观测,适用于少量异常且能估计合理替代值的场景。它可在一定程度上保留样本结构,但可能引入平滑偏差。

3.2.1 均值替换

均值替换以变量的平均值填补异常值,操作简便,适合分布较对称且异常较少的数据。不过,均值本身受极端值影响较大,因此该方法有时会放大偏差。

3.2.2 中位数替换

中位数替换使用变量的中位数代替异常值,较不受极端值影响,常用于偏态分布或稳健清洗场景。与均值替换相比,它通常更能保持总体中心位置。

3.2.3 邻近值替换

邻近值替换利用相邻时间点、相似个体或局部均值来修正异常观测。该方法在时间序列和有序数据中较常见,能较好地保持局部连续性。但若邻近值本身也受干扰,则替换效果会受限。

3.3 截尾与缩尾

截尾与缩尾是对极端范围进行限制的处理方式,常用于控制极端值对统计量的影响,同时尽量保留原始样本数。

3.3.1 上下分位数截断

上下分位数截断是将超出某一分位数范围的值直接限制在边界上。该方法可以压缩极端尾部的影响,使数据更集中于主体区间。它适合分布长尾明显、但不希望删除样本的情况。

3.3.2 Winsorization

Winsorization 通过将最小和最大部分的极端值替换为指定分位点的边界值来实现缩尾。与删除相比,它保留了样本数量;与简单替换相比,它更强调分布尾部的整体压缩。该方法常见于稳健统计分析中。

3.4 变换法

变换法通过对数据进行数学变换,减弱异常值的相对影响,或使分布更接近对称、稳定。它通常不直接改变异常值的身份,而是改变其在分析中的表现形式。

3.4.1 对数变换

对数变换适合处理正偏数据和跨度很大的数值,能够压缩大值、拉开小值差异,从而减轻极端点的影响。它常见于收入、流量、计数等变量分析中。但该方法要求数据为正或经过平移处理。

3.4.2 Box-Cox 变换

Box-Cox 变换是一类参数化幂变换,可在一定范围内自动寻找更合适的尺度,使数据更接近正态并改善方差稳定性。它适用于连续正值数据,在建模前的预处理阶段应用较多。

3.4.3 标准化与稳健标准化

标准化通过均值和标准差对变量进行缩放,而稳健标准化则常使用中位数与四分位距替代均值和标准差。后者对异常值不敏感,更适合存在极端观测的数据。通过缩放处理,异常值虽仍存在,但其相对影响可能减弱。

3.5 保留法

保留法强调不轻易删除异常值,而是将其视为可能有意义的信息来源。该思路适用于研究极端现象、稀有事件或异常本身就是研究对象的情形。

3.5.1 作为真实极端值保留

若异常值经过核实属于真实现象,则可直接保留,并在解释结果时特别说明。这样能够避免因过度清洗而抹去关键特征。对于某些风险分析、医学观察或质量控制任务,这一做法尤为重要。

3.5.2 单独建模处理

单独建模处理是将异常样本与常规样本分开分析,或为极端值建立专门模型。这样可以同时兼顾主体规律和特殊事件,提高解释精度。该策略在多机制共存的数据中较有价值。

3.5.3 设为缺失值后再插补

若异常值暂时无法判断真伪,可先将其标记为缺失,再根据其他变量或邻近信息进行插补。此法兼顾审慎性与完整性,常见于复杂数据清洗流程中。需要注意的是,插补结果本身也应进行检验。

4 不同数据场景下的处理

异常值在不同数据类型中的表现差异明显,因此处理方式也应因场景而异。针对单变量、多变量、时间序列及非结构化数据,常需要采用不同的识别和修正逻辑。

4.1 单变量数据

单变量数据通常只涉及一个数值维度,异常值判断相对直观,但仍需结合变量类型与分布特征。

4.1.1 连续型变量

连续型变量常使用箱线图、Z-score 或分位数方法进行识别。处理时应关注变量本身的物理意义与合理范围,例如身高、温度或金额等。若变量呈明显偏态,优先考虑稳健方法而非直接依赖均值和标准差。

4.1.2 离散型变量

离散型变量如计数、等级或分类编码,异常往往表现为不合理取值或不符合编码规则的数值。此类问题更适合通过规则校验、频数检查和业务约束来识别,而不是单纯按连续变量思路处理。若属于计数型变量,也可结合泊松或负二项分布特征判断。

4.2 多变量数据

多变量数据中的异常往往体现在变量组合关系上,因此不能只看单列数值,需要综合关联结构进行分析。

4.2.1 相关变量联合判断

当多个变量彼此相关时,单独看某个变量可能并不异常,但联合起来却明显偏离常规模式。例如一组财务指标、实验指标或行为特征之间可能存在稳定约束。联合判断能够减少误判,更准确地识别结构性异常。

4.2.2 高维稀疏数据

高维稀疏数据中,大量零值或缺失值会削弱传统距离指标的效果,使异常识别更困难。此时常需结合降维、特征选择或稀疏表示方法来辅助判断。由于维度高、样本相对少,处理时尤其要避免过度拟合异常模式。

4.3 时间序列数据

时间序列中的异常值常与时间上下文有关,单点异常未必代表整体问题,但可能影响趋势、季节性与预测结果。

4.3.1 突发尖峰处理

突发尖峰通常表现为某一时刻的短暂大幅波动,可能来自传感器噪声、系统抖动或真实事件。处理方式包括平滑、邻近插值或标记保留,具体取决于尖峰是否具有业务意义。若是偶发噪声,适度修正即可。

4.3.2 趋势异常修正

趋势异常是指长期走势突然偏离原有轨迹,可能由于口径变化、设备故障或数据源切换造成。此类异常需要结合前后时段对比分析,判断是否应整体重标、分段建模或重新校正。对于趋势型数据,局部修补往往不如整体审视有效。

4.3.3 周期性异常识别

周期性数据中,异常可能表现为某些固定时点反复偏离,比如每日某时段、每周某天出现异常波动。识别时应先建立周期基线,再观察偏离程度。若不考虑周期结构,容易把正常季节变化误当成异常。

4.4 图像与信号数据

图像与信号数据中的异常值通常以噪点、伪影或局部失真形式出现,处理方式更依赖滤波、平滑和模式识别。

4.4.1 噪点剔除

噪点剔除是消除图像或信号中孤立、随机的小幅干扰。常见方法包括中值滤波、邻域平滑和阈值去噪。其目标是在尽量不破坏主体结构的前提下提高信噪比。

4.4.2 平滑处理

平滑处理用于降低局部波动,使曲线或图像边缘更连续。它可减轻偶发异常对整体轮廓的影响,但过度平滑会让真实细节消失。实践中通常需要在清晰度与稳定性之间折中。

4.4.3 伪影识别

伪影是由采集、压缩、重建或处理过程引入的非真实结构。它们看起来像数据内容的一部分,但实际上并不反映对象本身。识别伪影往往需要结合成像原理、设备特性或信号生成机制进行判断。

4.5 实验与调查数据

实验和调查数据中,异常值常与操作过程、问卷填写或受访者行为有关,既可能是错误,也可能是特殊反应。

4.5.1 仪器故障值

仪器故障值通常由设备失灵、校准偏移或采集中断引起,具有明显的技术异常特征。此类数据应优先核查原始记录和设备状态,再决定删除、修复还是标记。若故障时段可明确定位,常可做分段处理。

4.5.2 录入偏差值

录入偏差值多由人工操作失误造成,例如选项错填、单位误换、数值抄错等。它们可通过逻辑校验、范围检查和交叉验证发现。若原始纸质记录或问卷可追溯,通常可直接更正。

4.5.3 极端响应值

极端响应值指调查中明显高于或低于大多数回答的个案。它们未必错误,可能反映少数群体的真实态度或特殊经历。因此,在处理这类数据时应优先区分“回答失真”和“真实极端”两种情况。

5 机器学习中的异常值处理

在机器学习流程中,异常值处理不仅影响训练数据质量,也会改变特征分布、损失优化和模型泛化表现。通常需要把异常处理嵌入特征工程、训练和评估的整体流程中。

5.1 特征工程阶段处理

特征工程阶段是异常值处理最常见的环节,目标是让输入数据更稳定、更适合建模。

5.1.1 数据清洗

数据清洗包括识别错误记录、修正非法取值、统一单位和处理明显极端值。若清洗规则稳定且可复用,可显著提升后续建模质量。清洗过程应尽量保留可追踪性,避免“黑箱式”修改。

5.1.2 特征缩放

特征缩放可以减小不同量纲间的差异,降低少数极端值在距离计算和梯度优化中的主导作用。常见方法包括标准化、归一化和稳健缩放。对于对尺度敏感的算法,缩放尤为重要。

5.1.3 变量变换

变量变换可通过对数、幂变换或分段变换降低偏态与长尾影响,使模型更容易学习稳定关系。某些情况下,适当变换甚至比直接删除异常值更有效。变换后的特征需注意解释方式的变化。

5.2 训练阶段的稳健方法

稳健方法关注的是在异常样本存在时,模型仍能保持较好的学习能力与泛化效果。它们通常通过模型结构或损失函数来降低异常点的权重。

5.2.1 稳健回归

稳健回归通过替换或调整损失函数,减少异常值对参数估计的拉动。与普通最小二乘相比,它更不容易被少数极端点主导。该方法适合存在少量异常但又不希望简单删除的场景。

5.2.2 树模型的鲁棒性

树模型通常对单个异常值有较强容忍度,因为其分裂依据主要基于阈值和局部划分,而非整体距离。尽管如此,若异常值数量较多或分布很特殊,仍可能影响分裂方向与叶节点统计。实际应用中,树模型常被视为较稳健的基线方法。

5.2.3 损失函数设计

通过设计更稳健的损失函数,可以让模型对离群样本不那么敏感。例如某些损失在误差较小时保持精细拟合,在误差较大时则减弱惩罚增长。此类设计在深度学习与异常噪声场景中较常见。

5.3 评估阶段的注意事项

异常值处理不仅要看训练效果,也要关注验证与测试环节是否保持一致,避免因处理不当而高估模型性能。

5.3.1 训练集与测试集一致性

训练集和测试集应采用一致或可比的异常处理规则,否则模型评估结果可能失真。若训练阶段进行了截断、缩尾或变换,测试阶段也应使用相同标准。否则,特征分布的不一致会影响泛化判断。

5.3.2 数据泄漏风险

如果异常值识别和处理使用了全量数据的信息,可能把测试集特征“提前泄露”给训练过程,导致评估偏乐观。为避免这一问题,异常检测和参数估计应尽量在训练数据内部完成,并在验证流程中独立执行。数据泄漏是机器学习流程中的常见隐患。

5.3.3 异常值对指标的影响

异常值可能显著影响均方误差、平均绝对误差、准确率和召回率等指标,具体方向取决于任务类型和异常位置。若少量极端样本主导损失,模型优劣的比较可能被扭曲。因此,报告结果时常需说明异常处理方案。

6 方法选择原则

异常值处理没有放之四海而皆准的统一方案,应根据研究目标、分布特征、样本规模与业务规则综合判断。合理选择方法,往往比单纯追求“去异常”更重要。

6.1 结合研究目标

不同研究目的决定了异常值是“噪声”还是“信息”。方法选择应先明确分析任务,再决定是否处理及如何处理。

6.1.1 推断研究

推断研究更关注总体参数估计与显著性判断,因此对异常值的稳健性要求较高。若极端点影响结论稳定,应优先采用稳健统计或严格的核查流程。对于核心推断变量,处理规则需保持一致且可解释。

6.1.2 预测研究

预测研究更强调模型在新数据上的表现,因而可优先考虑对泛化能力友好的处理方式。若异常值对预测误差影响明显,可通过变换、缩尾或稳健模型进行控制。此类任务通常比推断研究更重视性能结果。

6.1.3 探索性分析

探索性分析重点在于发现模式、识别结构和提出假设,因此不宜过早删除异常值。极端点有时正是新现象的线索。此阶段更适合保留原始数据,同时辅以标记和分层观察。

6.2 结合数据分布

数据分布形态决定了异常值判定的基准。若忽略分布特征,容易出现过度识别或漏检。

6.2.1 正态分布数据

对近似正态分布的数据,可较多使用 Z-score、3σ 原则等基于均值与标准差的方法。此类方法在分布规则时效率较高,解释也较直观。若正态性不足,则应谨慎使用。

6.2.2 偏态分布数据

偏态分布中,数据尾部较长,均值容易偏移,因此更适合采用中位数、IQR 或稳健标准化等方法。直接沿用正态假设下的阈值,常会把正常尾部误判为异常。偏态越明显,稳健方法越有优势。

6.2.3 长尾分布数据

长尾分布本身就包含大量较大值或较小值,单纯依据极端程度判断往往不够准确。此时应结合领域知识和局部密度判断,区分“长尾特征”与“错误观测”。在很多商业和互联网数据中,这一问题尤其常见。

6.3 结合样本规模

样本量不同,异常值对统计量和模型的影响程度也不同。处理策略需要考虑样本稀缺性与冗余程度。

6.3.1 小样本处理

小样本中,删除少量异常值就可能显著削弱代表性,因此应格外谨慎。此时更适合先核查来源,再考虑替换、标记或稳健建模。若样本极少,保留真实极端值往往比清除更有价值。

6.3.2 大样本处理

大样本中,单个异常值对总体影响通常较小,但异常数量可能较多,形成系统性偏差。此时可通过自动化规则、批量筛查和分层处理提高效率。大样本处理更强调流程一致性和可复现性。

6.4 结合业务规则

业务规则能为异常值判断提供现实约束,避免纯统计标准脱离实际。很多时候,领域知识比单一算法更可靠。

6.4.1 阈值设定

阈值设定应依据物理规律、政策标准、经验边界或历史分布,而非随意选取。合理阈值能够提高识别准确性并增强可解释性。若阈值来自经验判断,最好在报告中说明依据。

6.4.2 人工复核

对于高影响或高不确定性的异常点,人工复核仍然十分重要。通过查看原始记录、上下文信息和业务背景,可以避免算法误判。尤其在关键决策场景中,人工核查常是必要环节。

6.4.3 记录处理日志

记录处理日志有助于保存异常识别规则、修改内容、时间节点和责任信息。这样既便于后续追踪,也有利于结果复现与审计。良好的日志制度通常是数据治理的一部分。

7 风险与争议

异常值处理虽然是常规步骤,但也伴随一定风险,尤其在自动化清洗和高影响决策中更需谨慎。

7.1 误删有效信息

最常见的风险之一是把真实极端现象误当作噪声删除。若这些样本恰恰代表重要规律,删除后会使结论偏向“平均化”。因此,清洗前最好先判断异常是否具有实际意义。

7.2 过度平滑与信息损失

过度使用缩尾、平滑或替换,会让数据失去原本的波动特征。虽然表面上看起来更整齐,但可能掩盖关键变化与稀有事件。对于需要保留分布尾部信息的任务,这种损失尤其值得注意。

7.3 主观阈值带来的偏差

许多异常判定依赖阈值,而阈值的设定往往带有一定主观性。不同研究者可能因经验不同而得出不一致结果。若阈值缺少明确依据,处理结果的稳定性与公信力都会下降。

7.4 可重复性与可解释性问题

若异常值处理步骤过于复杂,或依赖人工多轮判断,其他研究者可能难以完全复现。与此同时,若处理逻辑缺乏说明,最终结果也不易解释。为提高透明度,应尽量保留规则、参数与版本信息。

8 实践流程

异常值处理在实践中通常遵循“先识别、再判断、后处置、再验证”的流程。一个规范的流程不仅能提升数据质量,也能减少不必要的误删与偏差。

8.1 数据审查

首先应检查数据来源、字段含义、单位、取值范围和缺失情况,确认是否存在明显录入或采集问题。数据审查是异常处理的基础步骤,有助于建立对数据整体质量的初步认识。

8.2 异常识别

在完成初步审查后,可结合统计方法、图形展示和模型手段识别可疑点。通常会先筛出候选异常,再进一步核验其合理性。识别阶段不宜直接定性,应保留一定弹性。

8.3 成因判断

对候选异常进行成因判断时,需要结合业务知识、原始记录与上下文信息。应区分错误、噪声、特殊事件和真实极端值,不同成因对应不同处理策略。成因判断往往决定最终是否删除或保留。

8.4 处理实施

在确认处理方案后,可执行删除、替换、截断、变换或保留等操作。实施过程中应保持规则统一,避免同类问题采取不同标准。若涉及批量处理,最好先在小范围样本上验证效果。

8.5 结果验证

处理完成后,需要重新检查数据分布、统计量和模型表现,确认处理是否达到预期。若异常处理后主要结论发生显著变化,应回溯原始判断是否合理。结果验证是防止过度处理的重要环节。

8.6 处理记录与报告输出

最后应将异常发现方法、处理标准、修改数量、保留原则和验证结果整理成记录或报告。这样不仅便于项目交接,也有助于后续审计与复现。规范的报告输出通常应说明哪些数据被处理、为何处理以及处理后产生了什么影响。