简要回答
图像增强通过对训练图做随机几何/颜色变换,人工扩充数据分布,减轻过拟合并提升对光照、姿态、遮挡的鲁棒性。常用翻转、裁剪、颜色抖动、Cutout/Mixup;需与任务语义一致(数字勿上下翻转)。
标准回答
原理:在标注成本固定下,增强 = 对输入施加已知不变性变换,使模型见到更多「等价」样本,降低泛化误差。
常见增强
- 几何:水平翻转、旋转、缩放裁剪、仿射、弹性形变(医学)
- 颜色:亮度、对比度、饱和度、色调抖动;Grayscale
- 遮挡:Cutout、Random Erasing、CutMix(局部替换)
- 混合:Mixup、Mosaic(检测多图拼接)
收益
- 缓解过拟合,尤其小数据集
- 提升光照、尺度、遮挡鲁棒性
- 隐式正则,等效更大 batch 多样性
实现:OpenCV、Albumentations、PyTorch transforms.v2、TensorFlow image 模块。
注意
- 语义保持:文字识别不宜剧烈扭曲
- 检测/分割需 同步变换 bbox/mask
- 过强增强会损害收敛;AutoAugment/RandAugment 学策略
回答思路
【定义】用一句话说清「图像增强如何提升视觉模型性能」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
检测不同步变换标注框;分类任务盲目上下翻转;把增强当成测试时必做步骤(TTA 除外)。
追问
追问 1:Mixup 和 CutMix 区别?
Mixup 线性混合两图及标签;CutMix 剪贴一块区域替换,标签按面积混合。CutMix 保留局部完整语义,分类检测都常用。
追问 2:增强能否替代更多真实数据?
不能完全替代。增强覆盖已知变换,难模拟新域(新相机、新场景)。真实多样性数据 + 适度增强最佳。
追问 3:测试时增强 TTA 有用吗?
对多翻转/尺度预测平均,常涨 0.5-2% 精度,但推理成本成倍增加。竞赛常用,线上需权衡延迟。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
