1 基本概念
1.1 定义与任务目标
语义分割是一类像素级视觉识别任务,其核心目标是将图像中的每个像素赋予一个语义类别标签,例如道路、天空、树木、车辆或行人等。与只给整张图像判断一个类别的任务不同,语义分割需要输出一幅与输入图像空间对应的类别图,从而刻画场景中各区域的语义分布。
这类任务通常强调“是什么”,即识别像素所属的对象类别,而不要求区分同类对象之间的个体差异。由于结果直接对应到图像中的局部区域,语义分割常被视为连接图像分类与目标检测的重要中间层技术。
1.2 与图像分类和实例分割的区别
图像分类关注的是整幅图像属于哪个类别,例如判断一张照片是“街景”还是“森林”。语义分割则进一步细化到像素层面,能够同时识别图像中多个区域的类别。
实例分割在语义分割基础上增加了实例区分能力,不仅要知道像素属于“人”这一类别,还要区分图中的不同个体。换言之,语义分割关注类别归属,实例分割关注类别与实例两层信息,因此前者的输出更偏向语义地图,后者则更接近对象级结构表达。
1.3 应用场景概览
语义分割已广泛应用于需要精细场景理解的领域。在自动驾驶中,它用于识别可行驶区域、车道线和道路参与者;在医学影像中,可帮助提取器官、病灶或组织边界;在遥感测绘中,常用于土地覆盖分类、建筑物提取与道路识别;在工业检测中,则可辅助发现表面缺陷、污染区域或零件轮廓;在机器人感知中,它有助于环境建模、路径规划和避障决策。
2 发展历程
2.1 传统图像分割方法
早期图像分割主要依赖手工设计特征和规则驱动方法,如阈值分割、边缘检测、区域生长、图割以及基于聚类的算法。这些方法在特定场景下具有一定效果,但通常对光照变化、噪声和复杂背景较为敏感,泛化能力有限。
传统方法往往依赖颜色、纹理、梯度等低层视觉特征,因此在语义层面的表达能力不足。随着场景复杂度提升,这类方法逐渐难以满足大规模、复杂环境下的精确分割需求。
2.2 深度学习兴起后的演进
深度学习推动了语义分割从“特征工程”向“端到端学习”转变。卷积神经网络能够自动学习多层次视觉表示,使模型在复杂场景中获得更强的识别能力。随着大规模数据集、GPU算力和优化技术的发展,语义分割的性能得到显著提升。
这一阶段的关键变化在于:模型不再仅输出类别判断,而是通过密集预测方式对整幅图像逐像素生成标签。为了恢复空间细节,研究者开始引入编码器-解码器、跳跃连接、多尺度上下文建模等结构,逐步形成了较成熟的技术路线。
2.3 代表性模型的出现
2.3.1 全卷积网络
全卷积网络将传统分类网络中的全连接层替换为卷积层,使网络能够接受任意尺寸输入并输出空间分辨率对应的特征图。这一设计奠定了现代语义分割的基础,也使端到端密集预测成为可能。
该方法的重要意义在于,它首次系统性地将图像分类网络改造为像素级预测框架。尽管输出分辨率通常仍需借助上采样恢复,但其结构思想对后续研究影响深远。
2.3.2 U-Net
U-Net最初面向医学图像分割设计,采用对称的编码器-解码器结构,并通过跳跃连接将浅层细节信息传递到高层重建阶段。该架构兼顾语义表达与边界恢复,因此在小样本和细粒度分割任务中表现突出。
由于结构清晰、训练相对稳定,U-Net被广泛改造并应用于多种领域,成为语义分割中最具代表性的模型之一。
2.3.3 DeepLab系列
DeepLab系列模型强调空洞卷积和多尺度上下文建模,尤其适合处理目标尺度变化较大的复杂场景。通过引入空洞空间金字塔池化等机制,该系列在保持较高分辨率的同时增强了感受野。
DeepLab的演进体现了语义分割从单纯恢复空间细节,逐渐转向兼顾上下文、尺度与边界信息的综合优化思路。
3 核心原理
3.1 像素级分类机制
语义分割本质上是对每个像素进行分类。模型需要根据像素周围的局部纹理、边缘形状及更大范围的上下文关系,判断其所属类别。输出通常表现为与原图大小相近的类别概率图,再通过取最大概率或其他后处理方式得到最终分割结果。
这种机制要求模型同时具备局部辨识能力和全局理解能力,因此其特征表达比普通分类任务更复杂。
3.2 特征提取与多尺度表达
图像中的不同目标往往具有不同尺寸和形态,单一尺度的特征难以适应所有情况。语义分割模型通常通过逐层卷积提取层次化特征:浅层保留边缘与纹理,高层包含更强的语义抽象能力。
多尺度表达可以通过金字塔结构、不同感受野卷积或多分支网络实现。这样既能识别大范围背景,也能兼顾小目标和细节区域,提高整体分割的适应性。
3.3 语义上下文建模
仅依赖局部像素信息往往不足以确定类别。语义上下文建模利用周围区域的关系来辅助判断,例如道路通常与车辆、车道线和建筑共同出现,天空往往位于场景上方。通过上下文信息,模型可以减少局部歧义带来的误判。
上下文建模常借助池化、注意力机制、图结构或全局特征聚合完成,有助于提升复杂场景中的识别稳定性。
3.4 边界与细节恢复
语义分割的一大难点是边界精度。由于卷积和下采样操作会造成空间信息损失,输出结果容易出现轮廓模糊、细节缺失或边缘偏移。为此,研究者常采用高分辨率特征融合、边界分支、细化模块或后处理方法来恢复细节。
在医学影像、工业检测等对轮廓要求较高的场景中,边界恢复能力往往直接影响最终应用效果。
4 模型架构
4.1 编码器-解码器结构
编码器-解码器是语义分割最常见的结构范式。编码器负责逐步提取高级语义特征,解码器则将压缩后的表示逐步还原为密集预测图。前者侧重理解,后者侧重重建,两者协同完成分割任务。
这一结构兼具灵活性与通用性,因此被广泛用于不同类型的数据和应用场景。
4.1.1 下采样与上采样
编码阶段通常通过池化或步幅卷积实现下采样,以降低空间分辨率并扩大感受野。这样做有利于提取更抽象的语义信息,但会带来细节丢失。
解码阶段则使用双线性插值、反卷积或像素重排等方式进行上采样,逐步恢复空间尺寸。下采样与上采样的平衡,是分割模型设计中的关键问题之一。
4.1.2 跳跃连接
跳跃连接用于把编码器浅层的高分辨率特征直接传递到解码器对应层,以弥补上采样过程中丢失的细节。它能够改善边缘定位,并使模型更容易保留纹理与结构信息。
这类连接方式在多种经典架构中都非常常见,尤其适合需要精细轮廓的任务。
4.2 空洞卷积与金字塔池化
空洞卷积通过在卷积核元素之间插入间隔,扩大感受野而不显著增加参数量,从而兼顾局部细节与全局上下文。它被广泛用于提升分割网络对大范围场景的感知能力。
金字塔池化则通过不同尺度的池化分支汇聚多层次上下文信息,使模型同时关注局部区域和全局布局。两者结合后,模型通常能更好地处理尺度变化明显的目标。
4.3 注意力机制的引入
注意力机制能够让模型根据任务需要动态分配特征权重,突出重要区域并抑制无关背景。在语义分割中,它常用于增强目标区域、边界区域或特定类别的响应强度。
常见做法包括通道注意力、空间注意力以及自注意力等。引入注意力后,模型对复杂背景中的目标识别通常更稳健,但计算开销也可能随之增加。
4.4 多分支与多尺度网络
多分支网络通过并行处理不同尺度、不同感受野或不同特征路径,提高模型对多样目标的适应能力。多尺度设计则通常结合不同层级的特征,以兼顾精细结构和语义抽象。
这类架构适用于道路、建筑、病灶和遥感地物等存在明显尺度差异的场景,能够减少单一特征尺度带来的偏差。
5 数据与标注
5.1 数据集类型
语义分割数据集通常根据应用领域分为通用场景数据集、医学影像数据集、遥感数据集和工业数据集等。不同数据集在图像分辨率、类别数量、标注粒度和场景复杂度上差异较大。
通用场景数据集多用于评估模型的综合能力,而专业领域数据集则更强调特定目标的精确识别与应用可行性。
5.2 标注方式与类别体系
语义分割标注通常以像素掩膜形式给出,每个区域对应一个类别标签。标注工作对精度要求较高,尤其在边界复杂、目标细小或重叠较多的情况下,人工成本较大。
类别体系需要根据任务目标进行定义,既要覆盖主要对象,也要尽量避免类别之间语义重叠。类别设计是否合理,往往直接影响模型训练效果和评估结果。
5.3 数据增强方法
由于高质量标注数据获取成本较高,数据增强成为提升模型泛化能力的重要手段。常见方法包括随机裁剪、翻转、缩放、旋转、颜色扰动、噪声注入和混合增强等。
适当的数据增强能够增加样本多样性,缓解过拟合,并提升模型对姿态变化、光照变化和噪声干扰的适应能力。
5.4 类别不平衡与长尾问题
在实际数据中,背景类别往往占据大量像素,而某些目标类别出现频率很低,形成明显的不平衡分布。长尾问题会导致模型偏向高频类别,对稀有类别识别不足。
为缓解这一问题,研究中常采用重加权、重采样、损失函数调整或专门的类别均衡策略,以提升少数类别的学习效果。
6 训练方法
6.1 损失函数
语义分割训练通常依赖像素级损失函数,目标是使预测标签尽可能接近真实标注。不同损失函数对类别不平衡、边界质量和小目标识别的敏感性不同,因此实际应用中常结合多种损失。
6.1.1 交叉熵损失
交叉熵损失是最基础的分割训练目标,衡量预测类别概率与真实标签之间的差异。它实现简单、优化稳定,广泛用于多类别分割任务。
在类别分布相对均衡时,交叉熵通常能取得较好效果,但在极度不平衡场景下可能偏向高频类别。
6.1.2 Dice损失
Dice损失来源于重叠度度量,常用于医学影像等前景区域较小的场景。它更关注预测区域与真实区域的整体重合情况,因此对小目标较为友好。
相比逐像素独立优化,Dice损失更强调区域一致性,常与交叉熵联合使用。
6.1.3 Focal Loss
Focal Loss通过降低易分类样本的权重,使模型更关注难分类样本和少数类别。它在目标分布不均衡、背景占比很大的任务中具有较强实用性。
该方法有助于提升模型对边界、细小目标和罕见类别的学习能力。
6.2 优化策略
语义分割训练通常采用随机梯度下降、Adam或其变体进行优化,并结合学习率调度、权重衰减、早停和正则化技术。合理的训练策略能够提升收敛速度并减少过拟合。
在实际训练中,批量大小、输入分辨率和学习率设置会显著影响模型稳定性与最终性能,因此往往需要针对具体任务进行调整。
6.3 迁移学习与预训练
由于分割标注成本较高,模型常先在大规模图像分类数据或相关分割数据上预训练,再迁移到目标任务中微调。预训练能够提供更强的初始特征表示,从而减少对标注样本数量的依赖。
迁移学习尤其适用于专业领域数据较少的情况,可以明显改善训练效率与泛化表现。
6.4 半监督与弱监督训练
半监督训练利用少量标注数据与大量未标注数据共同学习,常通过伪标签、一致性约束或教师-学生框架实现。弱监督则使用边界框、点标注、图像级标签等低成本信息来近似生成分割监督信号。
这两类方法的共同目标是降低标注成本,同时尽可能保留分割任务所需的空间精度。
7 评价指标
7.1 像素准确率
像素准确率表示预测正确的像素数占总像素数的比例,是最直观的评价指标之一。它反映整体分类正确程度,但在背景占比很大的任务中容易高估模型表现。
因此,像素准确率通常作为基础参考,而不单独作为最终判断依据。
7.2 平均交并比
平均交并比是语义分割中最常用的综合指标之一,计算预测区域与真实区域的交集和并集之比,并对各类别取平均。它能够较好反映分类正确性与区域覆盖程度。
相比像素准确率,平均交并比对类别不平衡更敏感,因此更能体现模型对不同类别的真实分割能力。
7.3 Dice系数
Dice系数衡量两个区域的重叠程度,常用于医学分割和前景检测任务。该指标对小目标的变化较敏感,适合评价边界相对明确的区域分割质量。
在某些应用中,Dice系数与平均交并比具有互补作用,常被同时报告。
7.4 边界质量指标
边界质量指标用于评估分割结果在轮廓处的精细程度,例如边缘对齐、轮廓偏差和边界完整性。对于医学影像、工业检测等任务,这类指标往往比整体重叠率更重要。
边界指标能够更准确地反映模型在细节恢复方面的实际水平。
8 典型应用
8.1 自动驾驶场景理解
在自动驾驶中,语义分割用于识别道路、车道线、人行横道、车辆、行人和交通设施等元素。它能够为路径规划、环境理解和安全决策提供空间级信息支持。
由于驾驶场景变化快、目标密集且实时性要求高,这一领域对分割模型的稳定性和速度都有较高要求。
8.2 医学影像分析
医学影像分割常用于器官勾画、肿瘤检测、病灶定位和术前规划。由于医学图像往往分辨率高、结构细微且噪声较大,语义分割在其中具有重要价值。
该领域对边界精度、召回率和可解释性要求较高,因此常采用专门设计的网络结构和损失函数。
8.3 遥感与地理信息处理
遥感图像分割可用于地表覆盖分类、建筑物提取、水体识别、道路网络分析和农业监测等。此类图像覆盖范围广、尺度变化显著,适合利用多尺度建模方法。
语义分割在地理信息处理中有助于从海量影像中提取结构化空间信息,提高制图与分析效率。
8.4 工业缺陷检测
在工业生产中,语义分割可用于定位表面划痕、裂纹、污渍、孔洞和材料缺陷等问题。相比简单分类,分割能够提供缺陷的精确位置和轮廓,便于后续处理。
该应用通常要求高精度、低漏检和较强实时性,因此模型轻量化和部署效率十分关键。
8.5 机器人导航与环境感知
机器人在室内外导航中需要理解可通行区域、障碍物和功能区域的分布。语义分割能为机器人提供环境的语义地图,帮助完成避障、定位和路径规划。
在动态环境中,模型还需适应光照变化、遮挡和视角变化,以保持感知稳定。
9 常见挑战
9.1 类别边界模糊
在复杂场景中,不同类别之间常存在过渡区域,例如阴影、反光、半透明物体或组织边缘。这些区域语义不清,容易导致模型产生边界漂移或标签混淆。
为改善这一问题,研究常从特征融合、边界监督和后处理等方向入手。
9.2 小目标与细粒度目标识别
小目标在图像中像素占比低,容易在下采样过程中被淹没;细粒度目标则往往依赖微弱的纹理差异。模型若缺乏足够分辨率或局部敏感性,容易漏检这些区域。
提升输入分辨率、引入多尺度特征和增强局部细节,是常见的应对方式。
9.3 计算资源与实时性
高精度分割模型往往参数量较大、计算开销较高,部署到移动设备或嵌入式平台时会受到显著限制。实时应用还要求模型在较短时间内完成推理,因此需要在精度和速度之间权衡。
轻量化网络、模型压缩和高效算子设计是这一问题的主要解决方向。
9.4 跨域泛化与鲁棒性
模型在某一数据集上训练后,迁移到不同拍摄条件、不同设备或不同场景时,性能可能明显下降。这种域偏移问题在实际应用中十分常见。
提高泛化能力通常需要更丰富的数据、域适应方法以及更稳健的特征学习策略。
9.5 标注成本与数据稀缺
高质量像素级标注耗时费力,尤其在专业领域需要依赖专家知识。数据不足会限制模型训练效果,也增加过拟合风险。
因此,减少人工标注依赖、提升样本利用效率,是语义分割长期面临的重要课题。
10 前沿发展
10.1 Transformer在语义分割中的应用
Transformer凭借全局建模能力进入语义分割领域后,增强了模型对长距离依赖和全局上下文的处理能力。与传统卷积网络相比,它更擅长建立远距离区域之间的关系。
当前不少方法将卷积与Transformer结合,以兼顾局部细节与全局语义理解。
10.2 自监督与基础模型
自监督学习通过未标注数据预训练,能够学习通用视觉表征,减少对人工标注的依赖。基础模型则倾向于在大规模数据上获得更强的通用能力,再适配到具体分割任务中。
这一方向有望降低训练门槛,并提升模型在多场景下的迁移能力。
10.3 轻量化与边缘部署
随着智能终端和嵌入式设备的发展,轻量化分割模型成为重要研究方向。通过网络剪枝、量化、蒸馏和高效结构设计,可以在较低算力条件下实现可用的分割性能。
边缘部署强调低延迟和低功耗,适用于车载系统、便携医疗设备和工业现场终端。
10.4 开放词汇与零样本分割
开放词汇分割尝试让模型识别训练中未显式出现过的类别,零样本分割则进一步追求在缺少目标类别标注的情况下完成识别。它们通常结合视觉-语言模型、文本提示和通用表征学习实现。
这类方法拓展了语义分割的类别边界,使模型具备更强的通用理解能力和应用弹性。