1.1 基本概念
机器学习是人工智能的核心分支,其基本概念可概括为:通过算法从数据中自动发现模式、构建模型,并利用模型对未知数据进行预测或决策。与传统的显式编程(为每一种情况编写规则)不同,机器学习系统从示例或经验中“学习”,从而能够处理模糊、复杂甚至人类难以手工定义规则的问题。其学习过程通常包含数据输入、特征提取、模型训练、评估与优化等环节,本质是统计学推断与计算优化的结合。
1.2 发展简史
1.2.1 早期探索(1950s–1970s)
机器学习的萌芽可追溯至20世纪50年代。1950年,艾伦·图灵提出“模仿游戏”(即图灵测试),奠定了智能机器可能“学习”的思想基础。1957年,弗兰克·罗森布拉特设计出“感知机”(Perceptron),这是最早的神经网络模型之一,能够对二分类数据进行线性划分。1960年代,决策树、最近邻算法等雏形相继出现。然而,1969年马文·明斯基与西摩尔·帕普特在《感知机》一书中严格论证了单层感知机的局限性,导致神经网络研究陷入低谷。整个70年代,机器学习更多被视作符号逻辑与专家系统的辅助工具,算法研究进展缓慢。
1.2.2 黄金时代与寒冬(1980s–1990s)
1980年代,机器学习迎来第一个黄金期。反向传播算法(Backpropagation)的提出使多层神经网络能够被有效训练;决策树算法(如ID3、C4.5)和基于统计的学习方法(如最近邻、朴素贝叶斯)逐渐成熟。同时,支持向量机(SVM)和集成学习方法(如AdaBoost)在90年代显示出强大性能。然而,90年代末期,由于算力限制、数据匮乏以及对神经网络可解释性的质疑,机器学习再次进入“寒冬”,研究重心转向概率图模型与核方法。这一时期也为深度学习埋下了伏笔。
1.2.3 深度学习崛起(2000s至今)
2006年,杰弗里·辛顿等人提出深度信念网络的无监督预训练方法,标志深度学习时代的开启。2012年,AlexNet在ImageNet图像识别竞赛中大幅超越传统方法,GPU加速和大量标注数据使深层卷积神经网络成为可能。此后,循环神经网络(RNN)、长短期记忆网络(LSTM)在自然语言处理中取得突破,Transformer架构(2017年)则彻底改变了序列建模范式。伴随大数据、云计算和开源框架(如TensorFlow、PyTorch)的普及,机器学习从实验室走向工业界,涌现出人脸识别、语音助手、自动驾驶等应用。近五年,大语言模型(如GPT系列)和扩散模型更将生成式AI推至巅峰。
1.3 与相关学科的关系
机器学习是多个学科的交叉产物。统计学提供了概率建模、假设检验、贝叶斯推断等基础工具;优化理论用于求解模型参数(如梯度下降、凸优化);计算机科学贡献了高效算法、数据结构与分布式计算;此外,信息论用于衡量信息增益与模型复杂度,控制论与强化学习的思想紧密相连。与人工智能的其他分支相比,机器学习更强调从数据驱动中自动获取知识,而专家系统或符号推理则依赖人工编码规则。近年来,机器学习与认知科学、神经科学也形成互动,试图解释人脑的学习机制。
2.1 监督学习
监督学习是机器学习中最常见的范式,其训练数据包含输入特征和对应的标签(即正确答案)。模型通过最小化预测值与真实标签之间的差异来学习映射关系,最终用于预测新样本的标签。
2.1.1 回归任务
回归任务的目标是预测连续数值,例如房价预测、气温预测。常用算法包括线性回归、回归树、支持向量回归等。评估指标侧重误差大小,如均方误差(MSE)、决定系数(R²)。
2.1.2 分类任务
分类任务则预测离散的类别标签,如垃圾邮件识别(二分类)、手写数字识别(多分类)。常用算法包括逻辑回归、决策树、支持向量机、朴素贝叶斯等。评估指标包括准确率、精确率、召回率等。经典案例:用鸢尾花数据集进行物种分类,至今仍是教学范例。
2.2 无监督学习
无监督学习的数据没有标签,模型需自动发现数据中的内在结构或模式。
2.2.1 聚类
聚类将相似的样本归为一组(簇),常见的算法有K-means、层次聚类、DBSCAN。应用场景包括用户分群、文档主题提取。评价指标如轮廓系数、Calinski-Harabasz指数。有趣的是,“调参”时选择K值往往靠肘部法则甚至玄学。
2.2.2 降维
降维通过提取主要特征减少数据维度,同时尽可能保留原始信息。主成分分析(PCA)是最经典的方法,t-SNE和UMAP则常用于高维数据可视化。降维不仅可加速后续算法,还能发现潜在变量。
2.3 半监督学习
半监督学习介于监督与无监督之间:使用少量标注数据和大量未标注数据一起训练。其核心假设是未标注数据能帮助模型更好地理解数据分布。典型方法包括自训练、协同训练、图半监督学习。在现实场景中(如医学影像标注昂贵),半监督学习极具实用价值——相当于让模型“偷师”未标记数据,但有时会学歪。
2.4 强化学习
强化学习并非通过标签或数据分布学习,而是让智能体(Agent)在环境中通过试错获取奖励(Reward)信号,逐步优化决策策略。典型应用包括游戏AI(AlphaGo、Dota 2的OpenAI Five)、机器人控制。
2.4.1 马尔可夫决策过程
强化学习通常建模为马尔可夫决策过程(MDP),包含状态、动作、转移概率、奖励和折扣因子。智能体根据当前状态选择动作,环境返回新状态和立即奖励。目标是找到最优策略使累积折扣奖励最大化。数学上常用贝尔曼方程求解。
2.4.2 探索与利用的平衡
强化学习的核心困境:智能体应当“利用”已知的最优动作来获取高奖励,还是“探索”未知动作以发现潜在的更高奖励?ε-贪心策略、UCB、汤普森采样等方法用于平衡两者。过度探索可能导致效率低下,过度利用则容易陷入局部最优,有点像程序员寻找最佳咖啡馆——总在熟悉的老店和未踩点的网红店之间纠结。
3.1 线性模型(线性回归、逻辑回归)
线性回归假设输入特征与输出之间呈线性关系,通过最小二乘法拟合系数。逻辑回归则引入Sigmoid函数,将线性输出映射到[0,1]区间以处理二分类。虽然名字带“回归”,逻辑回归却是分类算法。两者都是解释性强、训练快速的基础模型,常用于基线对比。缺点是难以捕捉非线性关系,需通过特征变换或引入多项式项弥补。
3.2 决策树与集成方法
决策树通过递归分割特征空间构建树状规则,每个叶节点对应一个预测值。优点是直观可解释,缺点是容易过拟合。集成方法通过组合多个弱学习器来提升性能。
3.2.1 随机森林
随机森林是Bagging思想的代表:随机抽取样本和特征,训练多棵决策树后取平均(回归)或多数投票(分类)。它能有效降低方差,无需过多调参即可取得不错效果,被戏称为“古早SOTA算法”。
3.2.2 梯度提升树(XGBoost、LightGBM等)
梯度提升树(GBDT)采用Boosting策略,每棵新树拟合前一轮的残差。XGBoost加入正则化项、二阶导数近似和列抽样,成为竞赛利器;LightGBM则采用直方图算法与叶子生长策略,大幅提升训练速度。CatBoost针对类别特征优化,这些工具在Kaggle上统治了表格数据多年。
3.3 支持向量机
支持向量机寻找一个超平面,使不同类别的边界(间隔)最大化。通过核技巧(如RBF核),可将数据映射到高维空间实现非线性分类。SVM在中小数据集上表现优异,泛化能力强,但面对大规模数据时计算成本较高。曾几何时,“只要有SVM,调调核参数就能发论文”的调侃颇为流行。
3.4 神经网络与深度学习
神经网络由多层神经元堆叠而成,每层进行线性变换和非线性激活,理论上可以逼近任意函数。深度学习特指包含多个隐藏层的网络,依靠反向传播和梯度下降训练。近年来,网络深度从几层发展到数百层,参数动辄数十亿。
3.4.1 卷积神经网络(CNN)
CNN通过卷积核提取局部特征,配合池化层降低维度,尤其适合图像数据。经典架构包括LeNet、AlexNet、VGG、ResNet、EfficientNet等。残差连接(ResNet)解决了深层网络的退化问题,让“越深越好”成为可能。
3.4.2 循环神经网络(RNN)
RNN引入隐状态(Hidden State)记录序列信息,适合文本、时间序列等顺序数据。但普通RNN存在长期依赖问题(梯度消失/爆炸),LSTM和GRU通过门控机制有效缓解。然而,RNN在长序列上训练缓慢,已被Transformer部分取代。
3.4.3 Transformer架构
2017年谷歌提出Transformer,完全基于自注意力机制(Self-Attention)和位置编码,不再依赖循环或卷积。它支持并行计算、捕获全局依赖,从而推动了BERT、GPT等大语言模型的发展。Transformer不仅统治了NLP,还向计算机视觉(ViT)、语音等领域扩展,堪称“万能架构”。
3.5 基于实例的学习(K近邻、KNN)
K近邻算法不显式构建模型,而是直接存储所有训练样本。预测时根据距离度量(如欧氏距离)找出最近的K个邻居,分类采用投票,回归采用平均。KNN简单直观,但计算和存储成本高,且对特征尺度敏感(需标准化)。K值的选择至关重要——太小易受噪声干扰,太大则边界模糊。
4.1 数据预处理与特征工程
原始数据往往充满缺失值、异常值、量纲差异等问题。预处理包括:缺失值填补(均值、中位数、插值)、异常值处理(截尾、替换)、数据标准化/归一化(Z-score、Min-Max)、类别特征编码(One-hot、Label Encoding)等。特征工程则涉及特征构造(如组合、多项式)、特征选择(过滤法、包裹法、嵌入法)与特征降维。有句名言:“数据和特征决定了机器学习的上限,而算法只是逼近这个上限。”
4.2 损失函数与优化器
损失函数量化模型预测与真实值之间的差距。回归常用均方误差(MSE)、均绝对误差(MAE);分类常用交叉熵损失(Cross-Entropy Loss);合页损失用于SVM。优化器负责更新模型参数以最小化损失,经典方法有梯度下降(GD)、随机梯度下降(SGD)、带动量的SGD、Adam、RMSProp等。其中Adam因自适应学习率而成为默认选择,但有时SGD配合良好的学习率调度反而更优。
4.3 过拟合与欠拟合
过拟合指模型在训练数据上表现极好,但在新数据上泛化差,表现为高方差。欠拟合则指模型未能捕捉数据的基本结构,训练和测试误差均高,表现为高偏差。应对过拟合的方法包括:增加训练数据、降低模型复杂度(L1/L2正则化)、使用Dropout、早停法(Early Stopping)等。欠拟合则需增加特征、提升模型容量或减少正则化强度。
4.4 评估指标
4.4.1 分类指标(准确率、精确率、召回率、F1)
准确率(Accuracy)是正确预测的比例,但面对类别不平衡时可能失准。精确率(Precision)衡量预测为正例中真正的正例比例,召回率(Recall)衡量实际正例中被正确找出的比例。F1分数是二者的调和平均值,常用于综合评估。此外还有AUC-ROC曲线、混淆矩阵等工具。在欺诈检测这类场景中,宁可误报也不放过——但误报太多也会被用户吐槽。
4.4.2 回归指标(MSE、MAE、R²)
均方误差(MSE)对较大误差惩罚更重,均绝对误差(MAE)则更稳健。决定系数(R²)表示模型解释了多少方差,取值越接近1说明拟合越好。注意R²有可能为负数(当模型比均值预测还差时),如同考试得了负分——理论上存在,实战中只想删除这个结果。
4.5 交叉验证与调参
交叉验证是将数据集切分成多份,轮流用部分训练、部分验证,从而更可靠地评估模型性能。最常用的是K折交叉验证(K=5或10)。留一法(LOOCV)适用于小数据集,但计算开销巨大。
4.5.1 网格搜索与随机搜索
网格搜索(Grid Search)穷举所有超参数组合,简单但维数灾难时很慢;随机搜索(Random Search)则在指定分布中采样,往往能以更少尝试找到相近的优质组合。
4.5.1.1 贝叶斯优化
贝叶斯优化通过概率代理模型(如高斯过程)和经验结果主动选择下一个超参数组合,比随机搜索更高效,尤其适用于调参成本很高的情况(如深度学习)。它能在较少试验中逼近最优解,但实现稍复杂。
4.5.2 “调参侠”的日常调侃
在机器学习社区,常有人自嘲为“调参侠”——指花大量时间手动调整学习率、批次大小、正则化系数等超参数,试图把模型性能从0.953提升到0.954。虽然自动调参工具(如AutoML、Optuna)逐渐普及,但许多人仍沉浸在“改一点点就重新跑一次”的玄学中,并坚信“运气的权重远大于算法”。这种调侃背后,实际上反映了模型调优中经验与直觉的重要性——以及,很多情况下,盲目调参不如多清洗一遍数据。
5.1 计算机视觉
机器学习在计算机视觉中应用最广,包括图像分类、目标检测(YOLO、Faster R-CNN)、图像分割(U-Net)、人脸识别、姿态估计等。从安防监控到自动驾驶,从医学影像诊断到短视频滤镜,视觉AI几乎无处不在。代价是,模型偶尔会把熊猫误判成长臂猿,这种“人工智障”时刻总会登上社交平台热搜。
5.2 自然语言处理
自然语言处理(NLP)使机器理解、生成人类语言。典型应用包括机器翻译(Google Translate)、情感分析、文本摘要、问答系统(如Siri、ChatGPT)。Transformer和预训练语言模型(BERT、GPT)已大幅提升NLP性能,不过模型依然容易在逻辑推理题和“说反话”上翻车。
5.3 推荐系统
推荐系统根据用户历史行为预测偏好,常见于电商(亚马逊、淘宝)、视频平台(抖音、YouTube)、内容网站(Netflix)。协同过滤、矩阵分解、深度神经网络(DIN、DeepFM)是主流方法。推荐算法的陷阱包括信息茧房和“猜你喜欢”变成“你猜我不喜欢”,比如刚分手就推荐情侣餐厅。
5.4 金融风控
机器学习在金融领域用于信用评分、欺诈检测、反洗钱、量化交易等。逻辑回归、梯度提升树和深度神经网络可分析大量交易数据,降低坏账率。但模型不可解释性是风险点——银行拒绝贷款申请时,只能说“AI觉得不行”,客户可能会拍桌子要求看代码。
5.5 医疗健康
机器学习辅助医学影像诊断(X光、CT、病理切片)、药物发现、基因组分析、预测疾病风险等。深度学习在眼科疾病筛查、皮肤癌识别中已接近或超过人类专家水平。然而,医疗数据涉及隐私且标注成本极高;模型一旦出错后果严重,因此常被定位为“辅助诊断”而非替代医生。
6.1 数据偏见与公平性
训练数据如果带有历史歧视(如种族、性别、地域偏见),模型会放大并固化这些偏见。例如,招聘算法可能因历史数据中男性工程师多而歧视女性简历;人脸识别对深色皮肤准确率较低。如何检测、缓解偏见并保证公平性,是机器学习工程性和社会性交叉的核心问题。目前常用方法包括再平衡采样、对抗去偏、公平性约束等,但尚无银弹。
6.2 可解释性
很多复杂模型(深度神经网络、集成模型)如同黑箱,人们难以理解内部决策逻辑。在医疗、金融、司法等高风险领域,用户和监管部门要求“可解释的AI”。目前有LIME、SHAP、注意力权重可视化等解释方法,但大多为近似解释。有趣的是,当模型说“因为你的芝麻信用分不够高”,用户勉强能接受;当模型说“因为维度37在输入嵌入空间中处于负半平面”,用户只想说人话。
6.3 隐私与安全
机器学习模型可能泄露训练数据中的敏感信息,例如成员推断攻击可判断某人的数据是否出现在训练集中。联邦学习、差分隐私、同态加密等技术试图在训练和使用过程中保护隐私。安全方面,对抗攻击(如给图片加肉眼不可见的噪声导致模型误判)对自动驾驶等系统构成真实威胁。黑客甚至能通过“模型窃取”复制商业AI模型,相当于偷走了工程师的熬夜成果。
6.4 环境能耗(绿色AI)
训练大型深度学习模型(如GPT-3)消耗的电力和碳排放量惊人,一次训练相当于数百个家庭一年的用电量。这引发了“绿色AI”的倡导,研究方向包括模型压缩(剪枝、量化)、知识蒸馏、高效架构(如MobileNet、EfficientNet)、使用可再生能源等。也有一些讽刺将AI训练比作“用化石燃料点亮神经网络”,不过随着液冷和低精度计算的发展,能耗问题正在缓解。
7.1 自动机器学习(AutoML)
AutoML旨在自动化机器学习流程中的繁琐环节,包括数据预处理、特征工程、模型选择、超参数调优、神经架构搜索(NAS)。工具如AutoGluon、TPOT、H2O AutoML、Google AutoML等已走入实践。未来AutoML可能让非专业人员也能轻松应用机器学习,同时将专家从“调参侠”身份中解放出来——届时“调参”将成为一门考古学。
7.2 量子机器学习
量子计算机利用量子叠加和纠缠态,有望在某些计算任务上指数级加速。量子机器学习探索如何用量子算法处理线性代数、核方法、优化问题等。目前尚处于理论和小规模实验阶段,量子硬件仍受噪声困扰。但一旦量子优势在机器学习中兑现,传统算法可能面临颠覆——想象一下,训练一次GPT-3只需几分钟而不是几个月。
7.3 通用人工智能之路
当前机器学习系统大多为专用(窄AI),缺乏常识、迁移能力和自主意识。通用人工智能(AGI)的目标是让机器具备与人类相当甚至更全面的智能。大语言模型展示出一定程度的任务泛化,但远未达到AGI。路径上,符号与神经结合的神经符号系统、具身人工智能(Embodied AI)、持续学习等方向被寄予厚望。尽管距离真正AGI可能还有几十年甚至遥遥无期,但机器学习作为核心引擎,将持续驱动人工智能的进化——顺便继续生产一些令人啼笑皆非的“智能”产物。