←
正则化编辑历史
提交《正则化》修改,状态:approved
查看这次修改
# 正则化 ## 1 概述 正则化(Regularization)是机器学习和统计建模中用于防止过拟合的核心技术之一。其基本思想是在损失函数中引入一个与模型复杂度相关的惩罚项,通过约束参数的大小或数量,迫使模型在拟合训练数据的同时保持简单,从而提升对未见过数据的泛化能力。常见的正则化形式包括L1正则化(Lasso)、L2正则化(Ridge)和弹性网络,广泛应用于线性回归、神经网络、支持向量机等算法中。正则化不仅降低了模型对噪声的敏感度,还常被用于特征选择和高维数据处理中。 ## 2 过拟合与正则化的动机 ### 2.1 过拟合的直观表现 过拟合是指模型在训练数据上表现极好(如损失趋近于零),但在测试数据上表现糟糕的现象。直观上,过拟合模型过度“记忆”了训练样本中的噪声和异常点,导致决策边界异常曲折,甚至将单个样本的偶然特征视为规律。例如,在二维分类问题中,一个过拟合的分类器可能会画出复杂的曲线将所有训练点精确分隔,但在新点面前却毫无招架之力。 ### 2.2 偏差-方差权衡 在统计学习理论中,模型的总误差可分解为偏差(Bias)、方差(Variance)和不可约误差三部分。简单模型(如线性回归)偏差高、方差低,容易欠拟合;复杂模型(如高阶多项式)偏差低、方差高,容易过拟合。正则化通过引入约束,在偏差和方差之间寻找平衡点——适当增加一点偏差,大幅降低方差,从而降低整体预测误差。 ### 2.3 正则化的核心思想 正则化的核心是“向简单性妥协”。它不追求在训练集上的完美拟合,而是通过惩罚过大的参数或过多的特征,迫使模型学习更平滑、更稳定的映射关系。这种“有限制”的优化,相当于在模型的解空间中施加了一个局部约束,使其跳出“纯
Ciallo~(∠・ω< )⌒★