1 基本概念
1.1 定义与来源
Lasso 是一种带有正则化项的回归方法,全称为“最小绝对收缩与选择算子”(Least Absolute Shrinkage and Selection Operator)。它最初由统计学研究者在回归分析框架中提出,目的是在提高模型泛化能力的同时,让模型能够自动舍弃一部分不重要的变量。由于它兼具收缩与筛选两种作用,Lasso 很快成为高维统计和机器学习中常见的基础工具。
1.2 核心思想
Lasso 的核心思想是在拟合数据的同时,对系数大小施加约束,使模型不至于过度复杂。与单纯追求训练误差最小化的方法不同,Lasso 会主动压缩参数,并倾向于保留少量更有解释力的特征。这使它既适合预测任务,也适合变量筛选和模型简化。
1.2.1 L1 正则化机制
Lasso 使用 L1 正则化,即将系数绝对值之和加入损失函数。该机制会对较小系数产生持续压缩作用,且在优化过程中更容易将部分系数直接推到 0。正因为这种“硬性削减”特征,Lasso 在稀疏建模中表现突出。
1.2.2 系数稀疏化
所谓系数稀疏化,是指模型最终只保留少数非零系数,其余变量对应的权重被压缩为 0。这样一来,模型结构更简洁,特征贡献更清晰,也便于后续解释。稀疏化是 Lasso 最显著的性质之一。
1.3 与普通最小二乘法的区别
普通最小二乘法只关注残差平方和的最小化,不会主动约束系数大小,因此在变量较多或特征高度相关时容易产生不稳定估计。Lasso 则在拟合误差之外增加正则项,牺牲部分训练拟合度来换取更好的泛化表现和更少的有效变量。二者的差别,不仅体现在目标函数上,也体现在模型复杂度控制方式上。
1.4 应用场景概述
Lasso 常用于自变量数量较多、但真正有效特征较少的任务,例如高维回归、特征筛选、基因表达分析、文本建模和风险预测等。它也常作为更复杂方法的基础组件,用于构建分层选择、组结构选择或混合正则化模型。
2 数学形式
2.1 目标函数
Lasso 的典型目标函数可写为在平方损失基础上叠加 L1 惩罚项的形式。其基本表达为最小化残差平方和与系数绝对值之和的加权组合,其中正则化参数决定惩罚强度。参数越大,模型越保守,系数越容易被压缩。
2.2 约束形式与惩罚形式
Lasso 可以用两种等价方式表述:一种是惩罚形式,即在原损失函数中加入 L1 项;另一种是约束形式,即在系数绝对值和不超过某个阈值的条件下最小化残差。两种表达方式在理论上密切相关,便于从不同角度理解模型行为。
2.3 几何解释
Lasso 的稀疏性可以通过几何视角直观理解。其约束区域在二维或更高维空间中具有明显的“尖角”结构,而最优解往往落在这些角点附近,因此更容易出现某些系数恰好为 0 的情况。
2.3.1 约束区域的形状
与 L2 正则化形成的圆形或球形约束区域不同,L1 约束在低维情形下表现为菱形,在高维中则呈现多面体形态。边界上的尖角对应着坐标轴方向,这正是稀疏解更容易出现的几何基础。
2.3.2 稀疏解的形成原因
由于最优点经常与约束边界的棱角相切,优化过程会自然偏向若干坐标为零的解。换言之,Lasso 不是通过额外规则“手工删除”变量,而是在目标函数结构中内生地鼓励系数归零。
2.4 标准化与变量尺度影响
Lasso 对变量尺度较为敏感。如果各特征量纲差异较大,取值范围更大的变量往往会受到不公平的惩罚,从而影响选择结果。因此在实际应用中,通常会先对变量进行标准化或归一化处理,以确保正则化作用更均衡。
3 求解方法
3.1 坐标下降法
坐标下降法是求解 Lasso 的经典算法之一。它在每次迭代中只更新一个参数,其余参数保持不变,循环往复直至收敛。由于 Lasso 的目标函数可分解性较强,这种方法实现简单、效率较高,尤其适合中高维数据。
3.2 近端梯度法
近端梯度法适用于带非光滑正则项的优化问题。它将损失函数拆分为光滑部分和非光滑部分,在梯度下降的基础上结合近端算子更新参数。对 Lasso 而言,该方法能够较稳健地处理 L1 惩罚带来的不可导点。
3.3 最优子梯度法
由于 Lasso 的 L1 项在零点处不可导,子梯度方法可用于构造优化方向。最优子梯度法通过选取合适的子梯度迭代更新参数,能够在理论上处理非光滑优化问题。不过,相比坐标下降法或近端方法,它的收敛速度和实际效率往往不占优势。
3.4 现成软件与计算实现
现代统计软件和机器学习框架通常都提供了 Lasso 的标准实现。用户往往只需设定正则化强度、是否标准化以及交叉验证方式,即可完成训练与选择。实际工程中,求解器通常还会结合路径算法、warm start 和并行化技术以提升效率。
3.4.1 常用统计软件
在统计计算环境中,Lasso 常见于专门的回归建模扩展包中。这类工具一般支持不同类型的响应变量、交叉验证选参以及系数路径可视化,便于分析变量进入模型的顺序和稳定性。
3.4.2 机器学习库中的实现
在机器学习库中,Lasso 通常作为线性模型的一种正则化版本出现。相关接口往往兼容批量训练、参数网格搜索和模型评估流程,便于将其嵌入完整的预测管线中。
4 模型性质
4.1 特征选择能力
Lasso 的重要优势在于自动特征选择。对于大量候选变量,它可以将影响较弱的系数压缩为零,从而筛出相对关键的特征。这种能力使其在变量筛选和可解释建模中具有很高实用价值。
4.2 偏差与方差权衡
引入正则化后,模型参数会受到额外约束,通常会增加一定偏差,但同时降低方差。对于复杂数据集而言,这种权衡常常有助于提升测试集表现。Lasso 的目标并非无损拟合,而是在稳定性与灵活性之间寻找平衡。
4.3 多重共线性下的表现
当特征之间高度相关时,Lasso 往往会从中选择少数代表变量,而不是保留整组相关特征。这样做有助于简化模型,但也可能导致选出的变量依赖于样本扰动。对于强相关输入,Lasso 的选择结果有时较为“偏爱”某一个变量。
4.4 系数稳定性与局限
Lasso 的稀疏解虽然便于解释,但在数据轻微变化时,入选变量集合可能发生明显波动。尤其在特征相关性较强或样本数量不足的情况下,系数稳定性可能下降。因此,Lasso 适合做初步筛选,但不一定总能给出唯一而稳定的特征排序。
5 变体与扩展
5.1 岭回归与 Lasso 的比较
岭回归采用 L2 正则化,主要作用是缩小系数而非使其归零。相比之下,Lasso 更强调稀疏性。前者通常在处理大量相关特征时更平滑,后者则更适合变量筛选。两者各有侧重,适用场景并不完全相同。
5.2 Elastic Net
Elastic Net 结合了 L1 与 L2 正则化的优点,既保留一定的稀疏性,又增强了对相关特征组的稳定性。它常被视为 Lasso 的重要扩展,特别适合存在较强共线性的高维数据。
5.3 Group Lasso
Group Lasso 将特征按组进行约束,鼓励整组变量同时进入或同时退出模型。该方法适用于具有明确分组结构的数据,例如同一类别下的多项测量指标。它比普通 Lasso 更能体现群组层面的选择逻辑。
5.4 Adaptive Lasso
Adaptive Lasso 通过对不同系数施加不同权重,改善了标准 Lasso 在变量选择上的偏倚问题。其基本思路是对更可能重要的变量给予较弱惩罚,对不重要变量给予较强惩罚,从而提高选择精度。
5.5 稀疏回归的其他形式
除上述方法外,稀疏回归还包括非凸惩罚、分段收缩和结构化稀疏模型等多种形式。这些方法通常旨在进一步提升变量选择质量、减少估计偏差,或适应更复杂的数据结构。
6 参数选择
6.1 正则化参数 λ
λ 是 Lasso 中最关键的控制参数。它决定正则化强度,也直接影响模型稀疏程度。λ 较小时,模型更接近普通回归;λ 较大时,更多系数会被压缩至零,模型也会更简洁。
6.2 交叉验证
交叉验证是选择 λ 的常用方法。做法通常是将数据分成若干折,反复训练和验证,比较不同 λ 下的预测误差。通过这种方式,可以在训练集拟合和泛化能力之间找到较合适的平衡点。
6.3 信息准则
在一些统计建模场景中,也可借助信息准则选择参数,例如 AIC、BIC 或其扩展形式。信息准则强调模型复杂度与拟合质量的综合权衡,适合用于解释导向的建模流程。
6.4 模型评估指标
除了选择参数外,还需观察模型在测试集上的表现。常用指标包括均方误差、决定系数、分类任务中的准确率或 AUC 等。对于稀疏模型而言,特征数量与预测性能往往需要同时评估。
7 典型应用
7.1 高维数据分析
在变量远多于样本的情形下,Lasso 可帮助从大量候选特征中筛出有效信息,降低维度并增强可解释性。它因此成为高维统计分析中的常用工具之一。
7.2 生物信息学
在基因表达、蛋白质组学和临床指标筛选中,Lasso 常用于识别与目标变量关系最密切的少数生物标记。由于这类数据通常维度高、噪声较大,Lasso 的稀疏化特性十分契合需求。
7.3 金融建模
金融预测中常包含大量宏观指标、市场因子和技术变量。Lasso 可用于构建较简洁的风险模型、收益预测模型或因子筛选流程,帮助减少冗余变量并提升模型稳定性。
7.4 图像与信号处理
在图像重建、去噪和稀疏表示中,Lasso 可作为压缩感知和稀疏编码的基础方法之一。通过促使表示系数稀疏化,它能够在有限观测下恢复较有结构的信息。
7.5 预测建模中的变量筛选
在一般预测任务中,Lasso 常作为前置筛选步骤使用。它可以先从大量变量中选出若干候选,再交由其他模型进一步拟合,从而兼顾效率与解释性。
8 局限与注意事项
8.1 对相关特征的选择偏好
当多个特征高度相关时,Lasso 往往只保留其中少数一个或几个,这会使结果具有一定随机性。若研究目标是保留整组相关信息,则单独使用 Lasso 可能并不理想。
8.2 解释性与预测性能的平衡
Lasso 能提高可解释性,但并不总能给出最强的纯预测性能。过强的稀疏化会遗漏部分有用信息,过弱的正则化又会削弱简洁性。因此,实际应用中通常需要根据任务目标调整取舍。
8.3 数据预处理要求
Lasso 对缺失值、异常值和量纲差异较敏感,建模前通常需要进行清洗、标准化和必要的变换。若预处理不足,参数选择和变量筛选结果都可能失真。
8.4 小样本场景中的风险
在样本量较少、变量数量较多的情况下,Lasso 可能出现过度依赖局部信息的问题,导致所选特征不够稳定。此时应结合交叉验证、重复抽样或外部验证,谨慎判断模型可靠性。