←
超参数调优编辑历史
提交《超参数调优》修改,状态:approved
查看这次修改
# 超参数调优 ## 1 背景与动机 ### 1.1 超参数与普通参数的区别 在机器学习模型中,参数(Parameters)是模型在训练过程中从数据中自动学习得到的内部变量,例如神经网络的权重和偏置、线性回归的系数等。超参数(Hyperparameters)则是在训练开始之前由开发者手动设定的配置项,它们控制模型的结构、训练过程和正则化策略。超参数无法从数据中直接学习,其取值优劣直接影响模型的收敛速度、最终性能和泛化能力。 ### 1.2 调优的重要性:过拟合、欠拟合与性能瓶颈 超参数选择不当会引发典型的模型病态:过拟合(模型在训练集上表现优异但在测试集上泛化差)或欠拟合(模型未能捕获数据中的有效模式)。例如,过高的学习率可能导致训练发散,过低的则使收敛缓慢;过多的网络层数可能造成过拟合,过少则欠拟合。调优的目标是在偏差与方差之间寻找平衡点,突破模型性能瓶颈。 ### 1.3 历史发展:从手动试错到自动化搜索 早期机器学习实践中,调优主要依赖工程师的直觉与反复手动试验(俗称“炼丹”)。随着模型复杂度提升,人工试错成本急剧增加。2000年代后期,网格搜索和随机搜索被系统化提出;2010年代后,贝叶斯优化、进化算法等自动化方法兴起;近年,AutoML工具(如Optuna、Ray Tune)和神经架构搜索(NAS)将调优推向全自动时代。 ## 2 超参数类型 ### 2.1 模型结构相关 #### 2.1.1 神经网络层数与神经元数量 层数决定模型的深度,神经元数量决定每层的宽度。深层网络能拟合更复杂的函数,但带来梯度消失/爆炸风险;过宽的层易导致过拟合。常见做法是从小规模开始,逐步增加至验证性能不再提升。 #### 2.1.2 卷积核大小与步长 卷积核尺寸影响特征提取的感受野:小核(3×
Ciallo~(∠・ω< )⌒★