Semantic Segmentation(语义分割)
Semantic Segmentation给每个像素贴标签
亦作、亦称:语义分割
语义分割(Semantic Segmentation)是计算机视觉的核心任务之一,目标是为输入图像的每个像素分配一个语义类别标签,从而在像素级别理解场景内容。与图像分类或目标检测不同,语义分割输出的是与输入图像等尺寸的稠密预测图,每个像素都对应一个类别(如「人」「道路」「天空」),但不区分同一类别的不同个体。
概述
语义分割(Semantic Segmentation)是计算机视觉的核心任务之一,目标是为输入图像的每个像素分配一个语义类别标签,从而在像素级别理解场景内容。与图像分类或目标检测不同,语义分割输出的是与输入图像等尺寸的稠密预测图,每个像素都对应一个类别(如「人」「道路」「天空」),但不区分同一类别的不同个体。
任务定义
语义分割以像素为单位进行分类,是一种稠密预测任务。
- 输入:任意尺寸的 RGB 图像(或多光谱图像)
- 输出:与输入同尺寸的语义标注图,每个像素对应一个类别 ID
- 不区分个体:同一类别的所有像素归为同一标签,如场景中两个人被合并标注为「人」——这是与实例分割(Instance Segmentation)的核心区别
- 全景分割(Panoptic Segmentation)将语义分割与实例分割合并,对「可数物体」区分个体、对「背景区域」做语义标注
发展脉络
语义分割经历了从传统方法到深度学习的深刻演变。
- 2015:Long、Shelhamer、Darrell(UC Berkeley)发表 FCN(全卷积网络),将分类网络的全连接层替换为卷积层,实现端到端像素级预测,奠定现代分割基础(CVPR 2015)
- 2015: 陈等人(Google Brain)提出第一版DeepLab,引入空洞卷积(Atrous Convolution) 和全连接 CRF 后处理,大幅提升边界精度
-2015: U-Net发布(Ronneberger 等人),采用编码器-解码器结构与 跳跃连接 (Skip Connection),在医学图像分割中成为标准基线
- 2017: DeepLabv3 引入空洞空间金字塔池化(ASPP) ,无需 CRF 即可捕获多尺度上下文
-2021: SegFormer(Xie 等人,NeurIPS 2021)以轻量级 Mix Transformer 主干取代 CNN,凭借自注意力的全局感受野超越 CNN 基准
- 2022: Mask2Former(CVPR 2022)构建统一的掩码分类框架,可同时处理语义、实例和全景三类分割任务
核心机制
现代语义分割模型普遍采用以下设计要素。
- 编码器-解码器架构:编码器(骨干网络)提取多尺度语义特征,解码器逐步上采样至原始分辨率输出预测
- 空洞卷积(Atrous/Dilated Convolution):在卷积核元素之间插入间隔,不增加参数量的同时扩大感受野,是 DeepLab 系列核心创新
- 跳跃连接(Skip Connection):将编码器浅层特征直接拼接到解码器对应层,恢复空间细节,是 U-Net 的核心设计
- 多尺度上下文聚合:ASPP、金字塔池化模块(PPM)以不同尺度捕获局部与全局语义
- Transformer 自注意力:SegFormer、Mask2Former 等模型通过自注意力建模远距离像素依赖,克服 CNN 感受野局限
评测指标
语义分割的核心评测指标是基于区域重叠的 IoU 系列指标。
- IoU(Intersection over Union,交并比):单类别预测区域与真值区域的交集面积除以并集面积,取值范围 [0, 1],亦称 Jaccard Index
- mIoU(mean IoU):所有类别 IoU 的均值,是语义分割最通用的综合指标,用于 Pascal VOC、Cityscapes、ADE20K 等标准榜单
- Pixel Accuracy(像素准确率):分类正确的像素数占总像素数的比例,直观但对类别不平衡敏感,通常作为辅助参考
- 常用基准数据集:PASCAL VOC 2012(21 类)、Cityscapes(19 类,城市驾驶场景)、ADE20K(150 类,室内外场景)
主要应用
语义分割凭借逐像素的精细理解能力,已成为多个高价值领域的关键技术。
- 自动驾驶:实时解析道路、行人、车辆、交通标志,为规划模块提供可行驶区域信息
- 医学影像:对 CT、MRI、病理切片中的器官与病灶区域进行精确轮廓标注,辅助临床诊断与手术规划(U-Net 最初即为此场景设计)
- 遥感与卫星图像:对土地利用、建筑物、植被、水体进行大规模自动标注与监测
- 机器人感知:帮助机械臂识别可操作区域,支撑场景理解与自主导航
- 图像编辑与创作:为前景/背景分离、背景虚化、智能换装等功能提供像素级遮罩
经典架构一览
不同场景和需求催生了多种各具特色的语义分割架构。
- FCN(Long et al., CVPR 2015):首个端到端深度学习分割模型,奠定全卷积范式
- U-Net(Ronneberger et al., MICCAI 2015):医学图像分割标配,编码器-解码器配合跳跃连接
- DeepLabv3+(Chen et al., ECCV 2018):空洞卷积 + ASPP + 轻量解码器,长期占据 SOTA 榜单
- SegFormer(Xie et al., NeurIPS 2021):轻量级 Mix Transformer 主干,无位置编码设计,高效且精准
- Mask2Former(Cheng et al., CVPR 2022):统一掩码分类框架,可同时处理语义、实例和全景分割
局限与误区
语义分割在实际应用中有若干重要局限需要了解。
- 标注成本极高:像素级标注一张高分辨率图像往往需要数十分钟,远高于图像分类的单标签标注,是落地的主要瓶颈
- 边界误差集中:在类别边界模糊或遮挡严重区域(如树叶遮挡行人),预测误差往往集中在边缘像素
- 不区分个体:「语义分割」无法区分同类别的不同个体,若需区分请使用实例分割或全景分割
- mIoU 掩盖罕见类:mIoU 对类别频率不敏感,罕见类别的低分容易被高频类别的高分所掩盖,部署时需关注各类别单独指标
- 开放类别泛化差:标准模型对训练集未见过的类别会错误归入已知类,需要开放词汇分割(借助 CLIP 等视觉语言模型)来处理
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「给每个像素贴标签」
- 「逐像素分类」
- 「比检测更细」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
计算机视觉中的图像分割是什么?
[图像分割](/glossary/semantic-segmentation) 为每个像素分配类别标签。语义分割不区分同类实例;实例分割区分个体;全景分割统一 stuff+thing。是自动驾驶场景理解、医学影像与工业质检的核心技术。
- 中级概念查看详解 →
特征金字塔网络(FPN)解决了什么问题?
FPN 用自顶向下路径+横向连接融合多尺度特征,让小目标用上高分辨率+强语义特征,显著提升检测与分割。
- 中级概念查看详解 →
卷积神经网络的感受野(Receptive Field)是什么?如何计算?
感受野是一个输出神经元能"看到"的输入区域大小,逐层递推计算;有效感受野常小于理论值。
- 中级概念查看详解 →
SAM(Segment Anything)如何实现可提示的零样本分割?
SAM 用图像编码器+提示编码器+轻量 mask 解码器,靠海量掩码数据实现可提示的零样本分割。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Semantic Segmentation」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
