1 数学基础

1.1 权重定义

权重(Weight)在数学上表示一个数值因子,用于衡量某个变量或元素在整体中的相对重要性。在信息技术中,权重通常以实数形式出现,可正可负,其绝对值大小反映影响程度。

1.1.1 加权和公式

加权和是权重最直接的应用形式。设有一组输入值 \(x_1, x_2, \dots, x_n\),对应权重 \(w_1, w_2, \dots, w_n\),则加权和定义为:

\[ y = \sum_{i=1}^{n} w_i x_i \]

该公式广泛用于线性回归神经网络前向传播、多指标评价等场景。例如,学生成绩总分可视为各科成绩与学分权重的加权和。

1.1.2 归一化与约束

为保证权重的可比性或稳定性,常对权重施加归一化约束,使所有权重之和等于1(或满足其他线性条件)。常用的归一化方法包括:和为1归一化、最大绝对值归一化、Softmax归一化等。在概率模型中,权重还须满足非负约束,以对应概率分布

1.2 权重与偏置的关系

1.2.1 线性模型中的权重

在线性模型 \(y = w \cdot x + b\) 中,权重 \(w\) 决定各输入特征的斜率贡献,偏置 \(b\) 提供平移常量。权重反映了特征每变化一个单位时输出的变化量,而偏置确保模型能够拟合原点偏移的数据。二者共同构线性变换的基本参数集。

1.2.2 非线性模型中的权重

在非线性模型(如神经网络、核方法)中,权重不仅出现在线性组合阶段,还参与激活函数或核函数的计算。非线性模型通过多层权重与激活函数叠加,实现复杂函数逼近。此时权重的物理意义不再仅仅是斜率,而是隐含在深层特征映射中的抽象表示。偏置则在不同层中起到调整激活阈值作用

2 机器学习与神经网络

2.1 权重初始化

权重初始化是训练开始前的关键步骤,不当的初始化可能导致梯度消失、爆炸或收敛缓慢。

2.1.1 随机初始化

最简单的初始化方式是从某个分布(如均匀分布或高斯分布)中随机采样得到初始权重。通常设置均值为0、方差较小的分布,以保持各层输出的期望值稳定。过大的初值容易引发梯度爆炸,过小则可能导致神经元“死亡”。

2.1.2 预设策略(Xavier、He)

为了解决深层网络中的梯度问题,学者提出了多种自适应初始化策略:

  • Xavier初始化(Glorot初始化):适用于tanh或sigmoid激活函数,其方差设为 \( \frac{2}{n_{\text{in}} + n_{\text{out}}} \)(\(n_{\text{in}}\)为输入维度,\(n_{\text{out}}\)为输出维度),保证前向和反向传播信号方差稳定。
  • He初始化:适用于ReLU及其变体,方差设为 \( \frac{2}{n_{\text{in}}} \),以补偿ReLU将负值截断导致的能量损失

2.2 权重更新

训练过程中,权重通过优化算法不断调整以最小化损失函数

2.2.1 梯度下降

梯度下降法利用损失函数对权重的梯度进行更新:\(w \leftarrow w - \eta \frac{\partial L}{\partial w}\),其中 \(\eta\) 为学习率

2.2.1.1 批量梯度下降

每次更新使用全部训练样本计算梯度,优点是方向准确,缺点是计算量大且无法处理大数据集。

2.2.1.2 随机梯度下降

每次更新只使用一个样本计算梯度,速度更快、可在线学习,但梯度噪声大,收敛路径曲折。现代实践中常采用小批量(mini-batch)作为折中。

2.2.2 动量法与自适应学习

  • 动量法:累积历史梯度方向,在梯度方向一致时加速,在震荡时减速,如SGD with Momentum
  • 自适应学习率:如AdaGrad、RMSProp、Adam,它们为每个参数独立调整学习率,Adam因结合动量和RMSProp成为最常用的优化器之一。

2.3 权重的正则化

正则化通过在损失函数中添加惩罚项来抑制权重的过大或过多,防止过拟合。

2.3.1 L1正则化(稀疏性)

L1正则化向损失函数添加权重绝对值和 \(\lambda \sumw\)。由于L1在零点处不可导,它迫使许多权重精确归零,产生稀疏解。常用于特征选择。

2.3.2 L2正则化(权重衰减)

L2正则化添加权重平方和 \(\lambda \sum w^2\),使得权重向零收缩但不为零。在神经网络中常称为“权重衰减”(weight decay),能有效降低模型复杂度。其效果相当于在梯度更新时额外减去一个与权重成正比的项。

3 搜索排序与推荐系统

3.1 词项权重

在信息检索中,词项权重用于衡量文档中每个词的重要程度,以支持相关性排序。

3.1.1 TF-IDF

TF-IDF(词频-逆文档频率)是经典权重计算方法。词频(TF)指某词在文档中出现次数,逆文档频率(IDF)反映词的稀缺性,计算公式为 \(\text{IDF}(t) = \log \frac{N}{\text{df}(t)}\)。TF-IDF权重为二者乘积,高权重意味着词在当前文档中出现频繁且在其他文档中罕见。

3.1.2 BM25

BM25是TF-IDF的进阶版本,引入了文档长度归一化和饱和词频函数。其公式加入可调参数 \(k_1\) 和 \(b\),分别控制词频饱和程度和长度归一化力度。BM25在搜索引擎中表现优于朴素TF-IDF,是Lucene等系统的默认相似度算法。

3.2 页面权重

页面权重用于衡量网页在互联网中的重要性,是搜索引擎排名的重要依据。

3.2.1 PageRank算法

PageRank由谷歌创始人拉里·佩奇提出,将网页视为节点,超链接视为有向边。每个页面的权重视为来自其他页面的“投票”总和,并迭代计算直至收敛。公式为 \(\text{PR}(P) = \frac{1-d}{N} + d \sum_{Q \in \text{in}(P)} \frac{\text{PR}(Q)}{L(Q)}\),其中 \(d\) 为阻尼因子(通常0.85),\(L(Q)\) 为页面\(Q\)的出链数。PageRank使得高权重页面引用的页面也获得较高权重。

3.2.2 个性化权重

在推荐系统或个性化搜索中,页面权重可根据用户兴趣进行调整。例如,对某个用户经常访问的类别赋予更多权重,或在PageRank中引入个性化偏好向量(Personalized PageRank),使排名向用户偏好倾斜。

3.3 用户行为权重

用户交互数据(点击、收藏、购买等)可作为权重来源,反映用户隐式偏好。

3.3.1 点击率加权

基于用户点击日志,对不同行为赋予不同权重。例如,一次点击赋予1分,一次购买赋予10分,再配合归一化处理,形成综合得分用于排序。常见于电商和内容平台。

3.3.2 时间衰减权重

用户行为具有时效性,较近的行为比久远的行为更重要。时间衰减权重通常采用指数衰减函数:\(w(t) = e^{-\lambda (t_0 - t)}\),其中\(\lambda\)为衰减速率。例如,新闻推荐中三天前的点击权重可能仅为当天点击的30%。

4 优化与调参

4.1 手动调权

在没有自动优化工具时,开发者依靠经验或暴力搜索调整权重。

4.1.1 经验法则

根据领域知识设置初始权重或调整范围。例如,在图像分类中,颜色特征权重可低于纹理特征;在影视推荐中,导演权重大于服装设计权重。常用经验包括:先固定主要权重,再微调次要权重;权重的量级差异不宜过大,否则易导致数值问题。

4.1.2 网格搜索

将每个权重在预设范围内等距取值,枚举所有组合并进行交叉验证,选出最佳组合。由于维度爆炸,网格搜索仅适合较少权重(≤5个)的场景。实践中可配合粗搜+精搜两步走。

4.2 自动调权

利用数学或进化算法自动寻找最优权重组合。

4.2.1 贝叶斯优化

贝叶斯优化通过构建高斯过程代理模型来估计目标函数的后验分布,每次选择最有希望的参数点进行评估。它比网格搜索更高效,常用于深度学习的超参数(包括权重初始化、学习率、正则化系数等)搜索。

4.2.2 遗传算法

受自然选择启发,将权重编码为染色体,通过选择、交叉、变异操作迭代进化。适用于非凸、离散或噪声较大的优化场景。例如,在推荐系统多目标权衡中,可用遗传算法搜索点击率与转化率之间的权重比例。

4.3 权重共享与迁移

4.3.1 多任务学习中的共享权重

在同时完成多个相关任务的模型中,底层网络层共享权重参数,以学习跨任务通用表示。例如,一个图像识别网络可同时检测物体、识别场景和分割区域,共享卷积层权重,仅在顶层任务特定分支保留私有权重。

4.3.2 预训练模型的微调

将在大规模数据集上训练好的模型(如BERT、GPT)的权重迁移到目标任务,仅微调少量参数甚至保持大部分权重不变。微调时常用的策略是冻结底层若干层,只更新顶层权重,或者在全部参数上进行小学习率更新。权重共享大幅降低了训练成本和数据需求。

5 实践案例与趣闻

5.1 “权重过大”的翻车现场

5.1.1 过拟合与学习率过高的笑话

调参界流传着一个经典笑话:某工程师给模型设置学习率为1.0,结果梯度一步越过了最优解,权重直接飞到无穷大,模型输出“NaN”。同事调侃:“你这不是训练模型,是在训练它离家出走。”另一个著名梗是:当权重正则化系数设得太小时,模型把训练集的噪声也学得惟妙惟肖,甚至把背景中的一只苍蝇识别为“负样本——重要特征”。

5.1.2 搜索引擎“彩票”权重的轶事

早年搜索引擎在计算排名时,曾因权重分配不当闹出笑话。某电商网站发现其权重算法无意中给了“彩票”关键词极高的IDF权重,导致用户搜索“天气”时,前列结果全是彩票网站。运营人员苦笑着称之为“买一送一权重陷阱”。后经调整,加入了业务规则惩罚。

5.2 情感分析中的“性别权重”调侃

5.2.1 为什么AI总爱给“她”加权重?

在情感分析训练集中,包含“她”字的句子多为正面情感(如“她真美”“她很善良”),导致模型学到“她”这个词与正向情绪高度相关。于是当输入“她犯了一个错误”时,模型因“她”权重过大而给出正面预测。工程师调侃:AI是个忠诚的“男闺蜜”,永远给你的“她”多打一分。

5.2.2 调参民谣:“权重一调,老婆不要”

在调参社区流传一首打油诗:“权重一调,老婆不要;学习率一改,加班三天;Loss不降,头发先掉。”描绘了深度学习调参从业者的辛酸自嘲。其中“权重一调,老婆不要”特指在情感分类里若刻意降低某些性别词权重,模型会变得“情商下降”,让用户以为是“直男AI”。

6 其他领域的权重概念

6.1 统计学中的权重(加权平均)

在统计调查中,权重用于调整样本偏差。例如,一项全国人口调查若年轻群体样本过多,则给中老年群体观测值赋予更高权重,使加权平均更能代表总体。加权平均公式为 \(\bar{x}_w = \frac{\sum w_i x_i}{\sum w_i}\),与信息技术的加权和本质相同。

6.2 运筹学中的权重(多目标决策)

在多目标决策问题中(如投资组合优化、选址问题),每个目标(利润、风险、环境成本)被赋予一个权重,表示决策者的优先级。通过加权和目标函数转化为单目标问题,常用层次分析法(AHP)主观确定权重。

6.3 心理学中的权重(认知偏差)

心理学研究发现,人类在做判断时并非对信息等权处理,而是赋予近期信息、情绪化信息或权威信息更高的心理权重。例如,“峰终定律”(Peak-End Rule)指出人们对体验的回忆主要受峰值和结束时刻的权重影响。这一原理也被用于用户界面设计和广告投放策略中。