1 基本概念

1.1 定义

图像分割是指将一幅图像按照像素层面的属性差异,划分为若干互不重叠或部分重叠的区域,使同一区域内的像素在颜色、纹理、亮度、形状或语义上具有较高一致性。它既可以关注低层视觉特征,也可以直接对应到“物体”“背景”“边界”等更高层次的语义单元。

从处理流程上看,图像分割通常输出一张与原图尺寸相近的标签图或掩膜图,每个像素被赋予一个类别、实例编号或所属区域标记。与只给出整幅图判定结果的任务相比,分割更强调空间结构信息。

1.2 研究目标

图像分割的核心目标,是尽可能准确地恢复图像中不同对象和区域的轮廓,并保持区域内部的一致性与区域之间的可分性。对于自然图像,目标可能是识别行人、车辆、道路和天空;对于医学影像,目标则可能是提取器官、病灶或组织边界。

在实际研究中,分割往往不仅要求“分出来”,还要求“分得准”“分得细”“分得稳”。因此,研究者通常同时关注准确率、边界质量、推理速度和泛化能力等多个维度

1.3 与图像分类和目标检测的区别

图像分类关注的是整张图像属于哪个类别,输出通常是一个全局标签,例如“猫”“狗”或“风景”。它不描述对象在图像中的具体位置。

目标检测在分类的基础上进一步给出目标的大致位置,常以边界框形式表示,但边界框只是矩形范围,无法精确刻画目标轮廓。

图像分割则更进一步,直接在像素层面标注对象范围,因此能够提供更精细的空间信息。一般来说,分类回答“是什么”,检测回答“在哪儿”,分割则回答“每个像素属于什么”。

1.4 像素级理解的意义

像素级理解能够显著提高机器对场景结构的把握能力。对于复杂环境中的自动系统而言,知道目标的精确轮廓往往比仅知道其大致位置更有价值。例如,在自动驾驶中,车道线、行人边缘和可行驶区域的像素级识别,有助于路径规划与风险判断;在医学场景中,病灶边界的准确勾画直接影响诊断和治疗方案。

此外,分割结果常作为后续任务的基础输入,例如三维重建姿态估计、图像编辑和机器人抓取等,因此它在视觉系统中具有承上启下的作用

2 分割类型

2.1 语义分割

语义分割为每个像素分配类别标签,同一类别的所有目标会被视为一个整体,不区分不同个体。例如,画面中所有“人”像素会被标为同一类,而不会区分某个是行人甲、某个是行人乙。

这种方法适合关注“类别分布”的场景,常用于道路、建筑、植被、器官等区域识别。

2.2 实例分割

实例分割在语义分割的基础上进一步区分同类中的不同个体。比如图中有三辆车,模型不仅要识别它们都是“车”,还要分别给出三辆车各自的掩膜。

实例分割在拥挤场景、工业零件统计和目标计数中尤为重要,因为它能够同时提供类别信息与个体边界。

2.3 全景分割

全景分割将语义分割与实例分割结合起来,既对“可数对象”进行实例级分割,也对“不可数背景类”进行语义级标注。例如,行人、汽车等按实例区分,而天空、道路、墙面等按语义类别整体标识。

这种方法试图为整幅图像提供统一的像素级理解,因此更接近完整场景解析。

2.4 部分分割与层级分割

部分分割关注对象的局部组成部分,例如人体中的头部、躯干、手臂,或车辆中的车轮、车窗、车身。它强调对象内部结构而不只是整体轮廓。

层级分割则进一步体现“整体—部分”关系,将图像结构按层次组织起来。对于形态复杂的对象,这类方法有助于表达更精细的语义层次,也便于结构化分析

2.5 交互式分割

交互式分割允许用户通过点击、框选、涂抹或其他提示方式,引导模型快速得到目标区域。与完全自动分割相比,它更强调人机协同,能够在少量交互下获得较高质量的结果。

这种方式常见于图像编辑、标注辅助和前景提取等应用中,具有较高的实用性和灵活性。

3 传统图像分割方法

3.1 阈值分割

阈值分割是最直观的图像分割方法之一,其基本思想是利用像素灰度或颜色值的差异,通过设定阈值将图像划分为前景和背景,或多个类别区域。它实现简单,计算开销低,适合对比明显的图像。

3.1.1 全局阈值

全局阈值法使用单一阈值处理整幅图像,假设目标与背景在整体上具有稳定的灰度差异。典型做法包括固定阈值和自动阈值选择。

这类方法适用于光照均匀、目标边界清晰的场景,但在亮度变化较大或背景复杂时,效果往往受限。

3.1.2 自适应阈值

自适应阈值会根据局部区域的统计特征动态确定阈值,因此能够更好地应对光照不均、阴影干扰和局部对比度变化。

它常用于文档图像、工业表面检测和低照度图像处理,不过参数设置不当时也容易产生碎片化结果。

3.2 边缘检测方法

边缘检测方法基于图像中灰度、颜色或纹理的突变来寻找对象边界,再将边缘信息整合为区域分割结果。常见算子包括 Sobel、Prewitt、Canny 等。

这类方法对轮廓较为敏感,但单独使用时往往难以保证边缘闭合,因此通常需要结合后续区域填充或形态学处理。

3.3 区域分割方法

区域分割方法强调图像内部的连通性和相似性,通过从种子点或初始区域出发,逐步扩展重组区域。

3.3.1 区域生长

区域生长从一个或多个种子点开始,将满足相似性条件的邻近像素不断并入当前区域。其优点是结果较连贯,适合边界相对清晰的对象。

不过,种子点的选择和相似性准则会明显影响分割效果,且对噪声较为敏感。

3.3.2 区域合并与分裂

区域合并与分裂先将图像划分成较小单元,再根据相似性逐步合并,或从整体出发不断分裂为子区域。该策略兼具自顶向下和自底向上的特点,能够在一定程度上平衡局部细节与整体结构。

它常用于需要较稳定区域层次的图像分析,但流程相对复杂。

3.4 聚类方法

聚类方法将像素或超像素按特征相似性进行分组,借助统计学习思想实现分割。常见特征包括颜色、纹理、位置和梯度等。

3.4.1 K-means

K-means 将像素划分为预设数量的簇,使同一簇内特征尽可能接近。它实现简洁、速度较快,适合大规模数据的初步分割。

其局限在于需要事先指定类别数,对初始化较敏感,且难以处理形状极不规则的区域。

3.4.2 模糊C均值

模糊C均值允许每个像素以不同隶属度属于多个类别,因此比硬聚类更灵活。对于边界模糊或过渡区域,这种方式通常更符合实际图像的连续性

不过,它的计算成本较高,对噪声和参数也较敏感。

3.5 图论与优化方法

图论方法把图像看作一个图结构,像素或超像素是节点,邻接关系和相似性构成边,通过最小割、最大流或能量最小化来完成分割。该类方法能够统一表达局部平滑、边界惩罚和先验约束。

这类框架理论上较为严谨,也便于融入各种先验信息,但求解过程可能较复杂,且在大规模图像上计算代价较高。

4 基于深度学习的方法

4.1 卷积神经网络方法

卷积神经网络通过层级特征提取,将低层纹理、中层形状和高层语义逐步融合,是现代分割方法的重要基础。与传统方法相比,它更依赖数据驱动学习,能够从样本中自动提取有效表示。

4.1.1 编码器-解码器结构

编码器负责逐步下采样并提取高层语义,解码器则通过上采样恢复空间分辨率,以生成精细的像素级输出。为了弥补下采样带来的细节损失,模型通常会引入跳跃连接或多尺度融合。

这种结构已成为许多分割网络的通用范式。

4.1.2 U-Net及其变体

U-Net 以对称的编码器—解码器结构和跨层跳跃连接著称,尤其适合医学图像分割。它能够在恢复分辨率的同时保留浅层细节,对小样本场景也较友好。

其变体很多,通常在骨干网络、注意力机制、多尺度模块或损失函数上进行改进,以提升边界表现和鲁棒性。

4.1.3 FCN

全卷积网络将分类网络中的全连接层替换为卷积层,使模型能够接受任意尺寸输入并输出相应的密集预测结果。它被认为是深度学习语义分割发展的重要起点之一。

FCN 的出现推动了端到端像素级学习的普及,也为后续大量改进模型奠定了基础。

4.2 基于检测框架的实例分割

这类方法通常在目标检测的基础上增加掩膜预测分支,从而同时获得目标位置与精细轮廓。它兼顾检测能力与分割能力,特别适合多目标实例区分任务。

4.2.1 Mask R-CNN

Mask R-CNN 在两阶段检测框架中加入像素级掩膜分支,并通过精确对齐机制改善特征与空间位置的对应关系。它能够为每个检测框生成对应的实例掩膜,因此在通用实例分割任务中应用广泛。

该模型在精度和通用性方面表现突出,但推理速度相对较慢。

4.2.2 两阶段实例分割

两阶段实例分割通常先产生候选区域,再对每个候选目标进行分类、回归和掩膜预测。这种设计有利于提高定位准确率和实例区分能力。

其不足在于流程较长、计算较重,不过在精细识别任务中仍具较强竞争力。

4.3 基于Transformer的方法

Transformer 依靠自注意力机制建模全局依赖关系,能够在较大范围内捕捉像素或区域之间的关联,因此逐渐被引入分割任务。与卷积网络相比,它更擅长表达长距离上下文信息。

4.3.1 ViT相关架构

Vision Transformer 将图像切分为若干 patch,并将其视作序列输入,从而借鉴自然语言处理中的编码方式。相关架构在分割中常与卷积特征结合,以兼顾局部细节和全局关系。

由于原生 ViT 对数据规模和训练策略较为敏感,因此在分割场景中常需要专门设计以增强对空间结构的建模能力。

4.3.2 分割专用Transformer模型

分割专用 Transformer 往往针对密集预测任务优化,例如引入多尺度特征交互、解码器重构和位置编码增强等机制。它们试图在保持全局建模优势的同时,提高边界恢复和小目标识别能力。

这类模型拓展了分割方法的表达能力,也推动了视觉基础结构的进一步发展。

4.4 生成式与基础模型方法

生成式和基础模型方法强调大规模预训练与通用视觉能力,能够在较少任务特化训练的情况下完成分割。它们通常结合提示、文本或视觉引导,实现更灵活的交互式理解。

4.4.1 提示驱动分割

提示驱动分割通过点、框、粗掩膜或文本提示,引导模型定位目标区域。用户提供的提示越明确,模型输出通常越稳定。

这类方法特别适合快速标注、交互编辑和半自动分割场景,实用性较强。

4.4.2 开放词汇分割

开放词汇分割旨在识别训练集中未显式出现过的类别,通常借助视觉—语言联合表示完成泛化。它使分割从封闭类别集扩展到更灵活的概念空间。

这类方法代表了分割模型向通用认知能力发展的趋势,但对跨模态对齐和数据规模有较高要求。

5 关键技术环节

5.1 图像预处理

图像预处理用于改善输入质量,减少噪声和非目标因素对分割结果的影响。它既能提升传统方法的稳定性,也能帮助深度模型更快收敛。

5.1.1 去噪

去噪旨在抑制传感器噪声、压缩伪影或环境干扰造成的随机波动。常见方式包括中值滤波、双边滤波和基于学习的去噪模型。

适当去噪有助于保留边缘信息,但过强的平滑也可能削弱细节。

5.1.2 增强与归一化

增强包括对比度调整、亮度校正和锐化等操作,目的是突出目标区域特征。归一化则用于统一数据分布,减少不同图像之间的尺度差异。

这一步对训练稳定性和模型泛化能力具有重要影响。

5.2 特征提取

特征提取是分割系统的核心环节之一,负责从原始像素中抽取可用于区分区域的表示。传统方法依赖手工设计特征,而深度学习则通过网络自动学习多层特征。

高质量特征通常需要同时包含局部纹理、边缘线索和全局语义,才能更好地区分相似区域。

5.3 边界建模

边界建模关注目标轮廓的准确恢复,是提高分割质量的重要方向。很多模型在主体区域识别较好,但在细边缘、毛发、薄结构或模糊过渡处容易出错,因此边界建模显得尤为关键。

常见做法包括边界分支、边缘监督、轮廓约束和细化模块等。

5.4 后处理

后处理用于修正初始分割结果中的局部错误,使输出更连贯、更符合目标结构。它通常作为模型推理后的补充步骤,不一定依赖复杂训练。

5.4.1 形态学操作

形态学操作包括膨胀、腐蚀、开运算和闭运算等,常用于填补孔洞、去除小噪点和连通断裂区域。对于二值掩膜和规则形状目标,这类方法简单有效。

5.4.2 条件随机场

条件随机场常用于利用像素之间的空间一致性与边缘相似性,对分割边界进行细化。它能够在一定程度上减少孤立误分区并增强轮廓贴合度。

虽然这类方法在精细边界上有帮助,但计算开销较高,近年更多作为辅助模块使用。

5.5 多尺度处理

多尺度处理用于应对目标大小差异明显的情况。通过在不同分辨率上提取和融合特征,模型可以同时关注大范围语义结构与局部细节。

该技术在场景分割、遥感影像和复杂自然图像中都十分重要,因为同一画面往往同时包含大目标与细小对象。

6 数据集与标注

6.1 常用公开数据集

图像分割研究通常依赖公开数据集进行训练和评测。常见数据集涵盖自然场景、医学影像、自动驾驶和室内环境等不同领域,并配有像素级或实例级标注。

这些数据集为模型比较、算法复现和性能评估提供了统一基准,也推动了方法迭代。

6.2 标注方式

分割标注通常需要人工逐像素或逐区域描绘目标边界,因此比分类和检测更费时费力。标注质量直接影响模型上限。

6.2.1 像素级标注

像素级标注要求为图像中每个像素指定类别或实例归属,精度较高,但成本也最高。它常用于对边界要求严格的任务。

6.2.2 掩膜标注

掩膜标注通常以区域轮廓或二值遮罩形式表达目标范围,便于模型训练和实例区分。它是实例分割和交互式分割中的常见标注方式。

6.3 数据增强与类别不平衡处理

由于分割数据往往存在样本有限、场景单一或某些类别稀少的问题,数据增强与类别不平衡处理十分必要。常见增强包括翻转、裁剪、旋转、颜色扰动和混合增强等。

对于少数类别,研究者会采用重采样、损失加权、焦点损失或合成样本等方法,以缓解模型偏向高频类别的问题。

7 评价指标

7.1 IoU与mIoU

IoU用于衡量预测区域与真实标注区域的重叠程度,定义为交并比。它是分割任务最常见的指标之一。

mIoU则是对各类别 IoU 的平均,更能反映模型在整体类别上的均衡表现。

7.2 Dice系数

Dice系数同样衡量预测与真实区域的一致性,尤其常用于医学图像分割。与 IoU 相比,它对重叠区域的敏感度较高,在小目标任务中有时更能反映实际效果。

7.3 Precision与Recall

Precision 表示预测为正的部分中有多少是真正目标,Recall 表示真实目标中有多少被成功找出。二者分别反映误报与漏报情况。

在某些应用中,模型不但要追求高准确率,也要尽量避免漏检,因此 Precision 和 Recall 常需结合分析。

7.4 Boundary F1分数

Boundary F1 分数专门衡量边界质量,强调预测轮廓与真实边界的贴合程度。对于细长结构、复杂轮廓或边缘敏感任务,这一指标尤为重要。

它能够弥补仅看区域重叠而忽略轮廓细节的不足。

7.5 AP与实例级指标

在实例分割中,AP 常用于综合评估分类、定位和掩膜质量。实例级指标不仅关注像素覆盖,还考虑每个实例是否被正确识别和区分。

这类指标更适合多目标场景,能够反映模型对个体层面的处理能力。

8 应用领域

8.1 医学影像分析

图像分割在医学影像中应用广泛,例如器官轮廓提取、肿瘤检测、病灶定位和术前规划。由于医学图像常具有边界模糊、对比度低和样本有限等特点,分割技术在该领域往往承担关键任务。

其结果可辅助医生提高效率,也有助于量化分析和长期随访。

8.2 自动驾驶与智能交通

在自动驾驶和智能交通中,分割用于识别道路、车道线、行人、车辆、交通标志和可行驶区域。像素级理解有助于系统更准确地感知环境结构,从而支持决策和控制。

相较于单纯检测,分割对于狭窄车道、遮挡目标和复杂路况更具优势。

8.3 工业质检

工业场景中,分割可用于表面缺陷检测、零件轮廓识别、装配状态检查和异物剔除。由于工业产品往往形状规范、背景固定,分割模型在此类任务中能取得较高实用价值。

它还常与自动化分拣、计量和机器人抓取系统结合。

8.4 遥感与地理信息处理

遥感影像分割用于土地覆盖分类、建筑物提取、道路识别和农田监测等任务。由于图像尺度大、目标分布稀疏且背景复杂,多尺度和上下文建模在这一领域尤为重要。

分割结果可支持地图更新、资源调查和环境监测。

8.5 视频理解与动作分析

在视频理解中,分割可用于跟踪目标、分离前景与背景、分析人体部位变化以及理解动作过程。相比静态图像,视频场景还需要考虑时间连续性和帧间一致性。

因此,视频分割通常会结合时序信息,以增强稳定性。

8.6 AR/VR与人机交互

在增强现实和虚拟现实场景中,图像分割可实现虚实融合、背景替换、人物抠图和沉浸式交互。它还能帮助系统识别用户手势、身体部位或交互对象,从而提高交互自然度。

这类应用对实时性和边界精度都较为敏感。

9 典型挑战

9.1 边界模糊与遮挡

很多图像中的目标边界并不清晰,尤其在透明物体、阴影区域、毛发、烟雾或强遮挡条件下,分割很容易出现边缘错误。如何在局部不确定的情况下保持轮廓稳定,是长期存在的问题。

9.2 小目标与细粒度结构

小目标像素少、信号弱,容易在下采样过程中被淹没;细粒度结构则需要更高分辨率的表达能力。若模型过度强调语义信息,细节往往会丢失。

9.3 类别不平衡

在真实数据中,背景类或高频类别通常远多于稀有类别,导致模型偏向多数类。类别不平衡会使少见目标的识别效果明显下降,尤其在病灶、缺陷和异常检测中更为突出。

9.4 复杂背景与噪声

当目标与背景在颜色、纹理或形状上相似时,分割模型容易混淆。此外,噪声、压缩失真和拍摄条件变化也会影响结果稳定性。

9.5 泛化能力与域迁移

模型在一个数据集上表现良好,并不意味着能在新场景中保持同等效果。设备差异、成像条件变化和任务分布偏移都会带来域迁移问题。

因此,提高泛化能力、降低对特定数据分布的依赖,是分割研究的重要方向。

10 发展趋势

10.1 更高精度与更快推理

未来分割模型将继续追求更高的像素级精度,同时减少计算量和延迟,以适应实时系统和高分辨率场景。精度与效率的平衡将长期是设计重点。

10.2 弱监督与半监督分割

由于高质量像素标注成本较高,利用少量标注数据配合大量未标注数据的弱监督与半监督方法,正成为重要方向。此类方法可降低数据依赖,提高训练效率。

10.3 少样本与零样本分割

少样本分割希望模型只需少量示例即可学会新类别,零样本分割则进一步要求模型识别未见过的概念。它们有助于提升模型适应新任务的能力,减少重复标注成本。

10.4 开放世界分割

开放世界分割关注在未知类别、长尾类别和动态场景中的识别与更新能力。模型不仅要处理已知类,还要具备发现新类别并逐步纳入的能力,这使分割系统更接近真实应用环境。

10.5 轻量化与边缘部署

随着移动设备和嵌入式系统需求增长,轻量化分割模型受到重视。通过网络剪枝、量化、蒸馏和高效架构设计,模型可以部署到终端设备,在有限算力下完成实时分割任务。