1 概念动机:从参数稀疏到组级稀疏

组正则化是一类通过对模型参数施加“组级”约束或惩罚来实现稀疏性正则化方法。与逐参数独立处理不同,它把参数先组织成若干集合(组),再对每个组施加范数惩罚或结构性约束,从而让优化过程倾向于“整组一起变小”,甚至在训练后期把某些组完全压到零。

1.1 组的定义:参数集合、结构与特征分组

所谓“组”,通常指一组可以被共同操作的参数索引集合。组的粒度可以灵活选取:例如按神经网络的通道或滤波器划分(使得某个卷积核/通道整体被抑制)、按层划分(让整层参数被选择或丢弃)、按特征子集划分(把原始特征的若干维作为一个整体决策)、或按变量集合划分(在统计学习中对某类系数集合进行结构化筛选)。

组结构也可能是非互斥的:一些参数可以同时属于多个组,此时需要使用适配重叠结构的优化策略(见后文第3.3节)。

1.2 为什么要做组正则化:结构化稀疏、可解释性与压缩

组正则化的动机主要来自三个方面:

  1. 结构化稀疏:逐参数稀疏(常见于 L1 正则化)虽然能得到稀疏解,但通常不会直接对应到可高效裁剪的结构;相对地,组正则化更容易产生“整块为零”的结果,使模型剪枝与部署更自然。
  2. 可解释性提升:当业务上关心的是“某类特征是否有用”“某个子模块是否贡献明显”时,组级稀疏可直接对应组被保留或被丢弃的结论。
  3. 压缩与资源友好:把一个组整体置零后,可以在结构层面移除对应模块,从而减少存储与计算,且更容易导出为静态图或加速算子。

1.3 与逐参数正则化的对比:L1、L2 与组范数差异

逐参数正则化中,L1(绝对值和)倾向于产生稀疏系数,但稀疏可能分散在许多位置,难以对应结构裁剪。L2 则通常更偏向于“均匀收缩”,不直接制造稀疏。

组正则化的关键差异在于:它对每个组计算某种范数(例如组内参数的欧氏范数),然后对该范数施加惩罚。这样做会改变“收缩的单位”,使优化更倾向于让整个组整体趋向于零,而不是只抑制组内少数个体参数。

1.4 典型应用目标:选择组、丢弃组、保留结构

组正则化可用于多类目标,典型包括:

  • 选择组:在许多特征或子模块中,挑出对预测最有帮助的集合。
  • 丢弃组:通过惩罚强度促使无用组被压到零,便于剪枝。
  • 保留结构:在获得稀疏性的同时维持特定的体系结构(如通道级、滤波器级或层级结构),使输出更贴合工程需求。

2 数学表述与常见形式

组正则化通常在监督学习框架下与数据拟合目标相加形成总体目标。设模型参数被划分为若干组,每个组的参数向量记为 \(w_g\)。组范数正则项通常写成 \(\sum_g \|w_g\|\) 的形式(范数类型可变化),从而实现按组的结构性收缩。

2.1 监督学习中的一般目标函数

设训练集为 \(\{(x_i,y_i)\}_{i=1}^n\)。一般形式可写为 \[ \min_w \ \mathcal{L}(w; x,y) + \lambda \, \Omega(w), \] 其中 \(\mathcal{L}\) 是损失函数(例如平方损失交叉熵等),\(\Omega(w)\) 是组级正则化项,\(\lambda\) 为正则化系数,用于控制稀疏强度与拟合之间的权衡。

2.2 组 Lasso:按组施加范数惩罚

组 Lasso(group lasso)是最经典的组正则化形式之一。其核心思想是:对每个组计算一个范数,并对范数求和惩罚。

2.2.1 单组记号与组范数的选择

若组 \(g\) 包含的参数向量记为 \(w_g\),常见范数选择包括:

- 欧氏范数(L2范数:\(\|w_g\|_2\)。该选择会使组内参数在收缩时表现出特定的协同效果,常用于产生组级稀疏。
  • 其他范数:在特定结构需求下也可能采用其他范数,使得组内权重的几何形状与稀疏倾向发生变化。

范数选择通常会影响阈值行为、收缩速度以及最终稀疏结构的形态(见第3章的计算要点)。

2.2.2 组稀疏的直观机制

直观上,优化过程会比较“保留某个组”与“压缩该组”的成本:当某个组的贡献不足以抵消正则惩罚时,组范数对应的惩罚会促使该组整体减小,直至达到零。与 L1 的“逐坐标稀疏”相比,组 Lasso 更像是在比较“一个组整体是否值得保留”。

2.3 重叠组与分层组正则化

现实中很多结构不是天然互斥的:例如一个特征可能同时属于多个语义子集,或网络模块存在层次结构。为此,常见处理包括:

  • 重叠组正则化:参数同时属于多个组,正则项需要对每个组独立计算并组合,导致优化目标更复杂。
  • 分层组正则化:通过树形或层次化的组划分,让上层结构与下层结构的选择具有一致性约束或优先级。

这些扩展通常需要更精细的近端算子或优化策略(见第3.3节)。

2.4 组约束型正则化:从惩罚到可行域约束

除了“加惩罚”,组约束型方法也会把问题改写为在某种约束集合上最小化损失:即控制参数必须落在允许的组结构集合内。

2.4.1 约束与惩罚的等价/近似思路

在优化理论中,许多约束形式可以通过拉格朗日乘子转化为惩罚形式;实际计算中也常用近似或替代方案,使约束与惩罚之间形成可操作的对应关系。工程上,这常表现为同一思想在不同数学表达下的实现差异:有的实现更自然地采用近端算子(惩罚视角),有的则强调在迭代过程中投影到可行域(约束视角)。

2.5 变体与扩展:自适应组权重、稀疏组结构先验

为提升效果,组正则化常引入变体,例如:

  • 自适应组权重:对不同组赋予不同权重,使得先验或中间估计的可信度更高的组获得更合适的惩罚强度。
  • 稀疏结构先验:在已知某种结构更可能包含有效信息时,将先验融入组划分或正则项形式,从而让稀疏结构更符合预期。

这些扩展通常会影响训练的收缩路径与最终保留组的形态。

3 优化方法与计算要点

组正则化的计算核心在于:如何在迭代训练中有效地处理组范数带来的“非光滑”或“结构性”惩罚项。实践中,常结合近端梯度/近端算子框架,并配套适用于特定组结构(如不重叠、重叠)的策略。

3.1 近端梯度/近端算子框架

当总体目标可写成“光滑损失 + 非光滑正则”时,近端梯度法是一种常见选择。其基本流程是对光滑部分做梯度下降,再对正则项对应的非光滑部分施加近端算子,得到更新后的参数。对于很多组正则化形式,近端算子可以解析或高效计算,从而使训练成本可控。

3.2 组阈值(group thresholding)与闭式解(适用条件)

在一些常见场景下,近端算子会具有类似阈值/截断的闭式解,典型表现为:当某个组的范数低于与学习率、正则系数相关的阈值时,该组被整体置零;当高于阈值时,该组按比例缩小。此类“组阈值”机制解释了为什么组正则化往往能直接产生结构化稀疏。

需要注意的是,闭式解的可用性与组范数类型、组结构是否重叠等因素有关;若结构更复杂,可能只能采用数值求解或迭代近似。

3.3 处理重叠组的优化策略

当组重叠时,简单的逐组独立阈值往往不再适用。常见策略包括:

  • 引入辅助变量:把重叠结构拆解为多个子问题,再通过一致性约束合并结果。
  • 迭代近似近端算子:将重叠组的近端映射分解成可迭代求解步骤。
  • 替代正则项设计:通过改造正则项形式,使其更接近可用的近端算子结构。

这些方法的共同目标是保持训练效率,同时尽量保留组级稀疏的效果。

3.4 正则化系数与训练稳定性

组正则化通常对正则化系数 \(\lambda\) 与相关超参数较敏感。过大可能导致过度稀疏、欠拟合;过小则难以形成可用的组级裁剪结构。

3.4.1 超参数敏感性:如何选取组惩罚强度

选取策略一般以验证集性能为导向,并结合稀疏度目标(例如希望保留某个比例的组)。工程上常进行网格搜索或逐步调整:先保证收敛,再观察组保留率与任务指标的变化趋势,找到较平衡的折衷点。

3.4.2 标准化与尺度一致性的重要性

组的参数规模可能不同,若不进行尺度处理,惩罚会“偏向”某些范数更小或更大的组,从而造成不公平的收缩。常见做法包括对参数或特征做标准化、对组惩罚项引入归一化因子,使得不同组的惩罚比较在数值上更可解释。

3.5 训练技巧:加速收敛与数值实现细节

为了让近端训练更高效,实践中常用以下手段:

  • 学习率与动量/自适应优化器的搭配:在近端框架下对光滑部分更新策略进行调优。
  • 数值稳定处理:处理范数计算、阈值比较、零附近梯度或除零等问题。
  • 分阶段训练:例如先训练获得较好表示,再逐步增强组正则以形成稀疏结构。

这些技巧并非只为速度,也用于减少不必要的震荡和训练崩溃。

4 与模型结构和压缩的关系

组正则化与模型压缩之间存在天然联系:它通过结构化的稀疏诱导,使得删减对应的模块更直接,从而把“模型裁剪”从后处理变成训练的一部分。

4.1 通道/滤波器级稀疏:从正则化到结构剪枝

在卷积网络中,按通道或滤波器定义组,可以让训练过程在结构层面减少冗余特征。组范数接近零的通道/滤波器可以被视为可剪枝单元。与逐权重裁剪相比,结构剪枝通常能更好保留计算图的规则性,便于部署到硬件或优化器。

4.2 特征选择视角:组级变量筛选

在特征工程或线性模型中,按特征子集分组能够实现“组级筛选”。例如,当多个相关特征应共同进入或共同退出模型时,组正则化提供了结构化的选择机制,使得解释更贴合业务逻辑。

4.3 表征学习中的组级先验

在深层表征学习中,组划分可以编码某种结构偏好:例如把某些神经元集合视为同一语义片段,或把注意力模块的参数按子结构分组进行约束。这样做并不保证绝对的因果解释,但能在统计意义上偏向产生符合先验的稀疏表示。

4.4 与模型压缩的联动:稀疏化、蒸馏与量化的关系

组正则化产生的是稀疏结构;后续的压缩还可能包括蒸馏与量化。通常可以形成联动流程:

  • 稀疏化先获得结构裁剪的候选子网络;
  • 蒸馏用更紧凑的学生模型拟合教师输出以恢复精度;
  • 量化再降低权重/激活的数值精度以进一步减小模型体积与提升吞吐。

具体先后顺序取决于任务与硬件约束,但总体思路是利用结构稀疏作为“减少参数与算子”的基础,再叠加其他压缩手段。

4.5 组正则化带来的可解释输出

当训练后得到“哪些组被保留”,即可形成可解释结果。无论组对应的是通道、滤波器、特征子集还是层级模块,组级别的稀疏模式都能被映射为“模型依赖了哪些结构”。这类解释在模型调试与迭代中通常比逐参数可视化更易沟通。

5 评估指标与实验设计

评估组正则化的效果不仅看预测性能,还需要衡量稀疏结构的质量、结构可实现性以及不同设计选择的影响。

5.1 稀疏度指标:组保留率与参数量减少

常见稀疏度指标包括:

  • 组保留率:保留下来的组数量占总组数的比例。
  • 参数量减少:剪掉后剩余参数规模的变化。
  • 计算量变化:如果能将结构稀疏导出为实际算子(如去掉通道),还可衡量 FLOPs 或延迟变化。

这些指标帮助判断稀疏是否达到预期的结构粒度。

5.2 性能指标:精度、鲁棒性与泛化

标准任务指标(准确率、损失、召回率等)是基本要求。除此之外,组正则化可能带来不同形式的泛化差异,因此也可观察:

  • 鲁棒性:对噪声、分布偏移或输入扰动的表现。
  • 泛化:训练/验证集的差距变化,判断是否出现欠拟合或过度约束。

5.3 结构保持程度:计算图友好性与硬件适配

结构稀疏的价值在于易于实现。评估时可关注:

  • 是否能导出静态裁剪图:即剪枝后结构是否稳定、是否能对应到规则化算子。
  • 硬件适配程度:如是否能形成通道数对齐、算子维度可整除等工程友好条件。

5.4 消融实验:组划分、范数选择与超参数

消融实验通常包括至少三类对比:

  • 组划分方案:改变粒度(通道级 vs 层级)或改变分组方式。
  • 范数选择:例如组内用欧氏范数还是其他范数。
  • 超参数:不同 \(\lambda\) 或权重策略下的稀疏与性能权衡。

通过消融可明确“性能提升来自结构性稀疏还是仅来自正则化强度”。

5.5 可视化:哪些组被抑制与其学习轨迹

可视化常见形式包括:

  • 组保留/抑制热图:展示每个组的范数随训练步数变化。
  • 轨迹图:记录某些关键组从初始到被压到零的过程,帮助理解阈值何时触发、收缩是否过早发生。
  • 结构导出的对比图:剪枝前后的网络结构对比,用于直观展示压缩效果。

6 工程实践与注意事项

在工程实现中,组正则化的效果高度依赖于组划分、与模型结构的兼容性、以及训练到部署之间的一致性。

6.1 组划分策略:粒度选择与业务/架构映射

粒度选择直接决定稀疏结构的可用性。过细可能接近逐参数稀疏,难以带来硬件友好剪枝;过粗可能导致有效信息被一起抑制。实践中通常结合以下因素:

  • 模型模块边界:是否能与实际计算单元对齐(如通道、头、层)。
  • 业务含义:组是否对应某类可解释的实体或特征集合。
  • 目标资源约束:希望减少参数、减少延迟还是减少带宽,从而决定粒度与裁剪策略。

6.2 兼容不同模型:CNN、Transformer 与线性模型

  • CNN:常用通道/滤波器/层作为组,形成自然的结构剪枝接口。
  • Transformer:可以按注意力头、前馈子层或投影矩阵的子结构分组,以实现结构化裁剪。
  • 线性模型:按特征子集分组,实现组级变量选择,便于解释与稀疏输出。

不同模型的参数张量形状不同,组范数的计算与近端更新需相应调整。

6.3 训练-部署一致性:稀疏结构是否可导出为静态算子

一个常见工程问题是:训练中得到的是“数值上接近零”的结构,但部署时是否能稳定地变成“恰好为零并可删除”。因此需要考虑:

  • 阈值后处理:如何从训练得到的连续值决定最终保留集合。
  • 图导出流程:剪枝是否能转换为静态算子,避免运行时动态掩码带来的性能损失。
  • 数值容差:零附近的数值误差会影响裁剪决策,需要设置合理的判定规则。

6.4 与其他正则化/约束的组合:权重衰减、Dropout、早停

组正则化通常可与其他方法协同,但要注意相互作用:

  • 权重衰减(L2):提供基础收缩,可能改变组范数的尺度与收缩速度。
  • Dropout:缓解过拟合,但也可能影响组阈值触发的时机。
  • 早停:在稀疏尚未稳定形成前停得太早可能导致结构不理想;过晚又可能造成过度压缩或性能下降。

因此需要联合调参,并以验证集稀疏度与性能共同为准。

###6.5 常见失败模式:过度稀疏、训练不稳与组划分失配

常见问题包括:

  • 过度稀疏:正则过强导致关键结构被抑制,任务性能显著下降。
  • 训练不稳:尤其在学习率、归一化或近端更新设置不当时可能出现震荡。
  • 组划分失配:组的定义与实际希望删除的结构不对齐,导致虽然形成稀疏但无法有效加速或解释,甚至难以导出静态裁剪图。

这些问题通常通过调整 \(\lambda\)、改善组归一化、优化训练日程以及重新设计组划分来缓解。

7 相关术语与进一步阅读

组正则化与稀疏学习、结构化剪枝及近端优化方法密切相关。理解这些相邻概念有助于更系统地阅读论文与实现方案。

7.1 近端算法、稀疏正则化与结构化稀疏

近端算法用于处理非光滑正则项,是组正则化常用的优化工具。稀疏正则化则包含 L1、组范数惩罚等思想;结构化稀疏强调稀疏的“形状”,使剪枝与部署更可行。

7.2 L1/L2、Elastic Net 与 group lasso 的关系

  • L1 产生逐参数稀疏,容易得到非结构性的零散系数。
  • L2 更偏向平滑收缩,通常不直接带来稀疏。
  • Elastic Net 结合了 L1 与 L2 的优点,改善稀疏与稳定性之间的折衷。
  • Group lasso 则把稀疏单位从“单个系数”提升为“参数组”,形成结构化稀疏。

7.3 组稀疏、结构化剪枝与稀疏蒸馏

结构化剪枝是把稀疏结果用于减少网络结构规模的过程;稀疏蒸馏通常指用较小稀疏模型去拟合更大模型的输出,以提升压缩后的精度。组正则化常作为稀疏结构生成的训练手段,和后续剪枝、蒸馏配合使用。

7.4 参考实现与开源实现的选型要点

选型时可重点关注:

  • 是否支持所需的组结构(不重叠/重叠/层次化)。
  • 是否提供高效的近端更新或可复用的训练封装。
  • 是否能与现有剪枝与导出工具链对接,方便实现训练-部署一致性。
  • 是否给出清晰的超参数推荐与稳定性说明。