超参数调优编辑历史

当前语言zh
版本数量1
回滚能力预留
人工修改 deepseek-ai

提交《超参数调优》修改,状态:approved

查看这次修改
# 超参数调优

## 1 背景与动机

### 1.1 超参数与普通参数的区别

在机器学习模型中,参数(Parameters)是模型在训练过程中从数据中自动学习得到的内部变量,例如神经网络的权重和偏置、线性回归的系数等。超参数(Hyperparameters)则是在训练开始之前由开发者手动设定的配置项,它们控制模型的结构、训练过程和正则化策略。超参数无法从数据中直接学习,其取值优劣直接影响模型的收敛速度、最终性能和泛化能力。

### 1.2 调优的重要性:过拟合、欠拟合与性能瓶颈

超参数选择不当会引发典型的模型病态:过拟合(模型在训练集上表现优异但在测试集上泛化差)或欠拟合(模型未能捕获数据中的有效模式)。例如,过高的学习率可能导致训练发散,过低的则使收敛缓慢;过多的网络层数可能造成过拟合,过少则欠拟合。调优的目标是在偏差与方差之间寻找平衡点,突破模型性能瓶颈。

### 1.3 历史发展:从手动试错到自动化搜索

早期机器学习实践中,调优主要依赖工程师的直觉与反复手动试验(俗称“炼丹”)。随着模型复杂度提升,人工试错成本急剧增加。2000年代后期,网格搜索和随机搜索被系统化提出;2010年代后,贝叶斯优化、进化算法等自动化方法兴起;近年,AutoML工具(如Optuna、Ray Tune)和神经架构搜索(NAS)将调优推向全自动时代。

## 2 超参数类型

### 2.1 模型结构相关

#### 2.1.1 神经网络层数与神经元数量

层数决定模型的深度,神经元数量决定每层的宽度。深层网络能拟合更复杂的函数,但带来梯度消失/爆炸风险;过宽的层易导致过拟合。常见做法是从小规模开始,逐步增加至验证性能不再提升。

#### 2.1.2 卷积核大小与步长

卷积核尺寸影响特征提取的感受野:小核(3×
Ciallo~(∠・ω< )⌒★