核心要点
区分语义、实例、全景分割
说明像素级标注与 mask 表示
了解 FCN、U-Net、Mask R-CNN 等架构
举出医学、自动驾驶等应用
标准回答
一、先给出结论和背景
- 任务定义:输入图像 $H imes W imes 3$,输出 $H imes W$ 标签图(mask)。
- 分割类型:- 语义分割:同类像素同标签(路面、天空)
- 实例分割:区分每个行人、每辆车(Mask R-CNN)
- 全景分割:语义(stuff)+ 实例(thing)统一(Panoptic FPN)
二、拆开关键步骤和判断点
- 经典架构:- FCN:全卷积端到端,上采样恢复分辨率
- U-Net:编码器-解码器 + 跳连,医学常用
- DeepLab:空洞卷积扩大感受野 + ASPP
- Mask R-CNN:检测框 + 每实例 mask 分支
- 损失:交叉熵、Dice、Focal Loss(类别不平衡)
三、补上落地边界和取舍
面试里可以补一个视觉任务例子:计算机视觉中的图像分割是什么 在分类、检测、分割或多模态理解里分别会影响数据增强、模型结构、指标选择和误检漏检分析。这样回答会比单独讲概念更像真实项目经验。
回答思路
【定义】用一句话说清「计算机视觉中的图像分割」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:混淆检测框与分割 mask;语义实例不分;不说清评价指标(mIoU)。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
