Object Detection(目标检测)
Object Detection框出图里有什么
亦作、亦称:目标检测
目标检测是计算机视觉的核心任务,要求模型在图像或视频中同时完成「定位」与「识别」——用边界框标出每个物体的位置,并给出其所属类别。它是自动驾驶、安防监控、工业质检等场景不可或缺的感知基础。
概述
目标检测是计算机视觉的核心任务,要求模型在图像或视频中同时完成「定位」与「识别」——用边界框标出每个物体的位置,并给出其所属类别。它是自动驾驶、安防监控、工业质检等场景不可或缺的感知基础。
任务定义
目标检测与图像分类的关键区别在于:它不仅要回答「是什么」,还要回答「在哪里」,且须同时处理图中数量不定的多个目标。
- 边界框(Bounding Box):用矩形框 (x, y, w, h) 标注目标位置,是检测输出的基本单元
- 类别标签:为每个框分配语义类别(如行人、车辆、红绿灯)
- 置信度分数:模型对该框内确实存在目标的把握程度
- 多目标并发:单张图像中同一类别可出现多个实例,需逐一检测
- 与语义分割的区别:检测输出框而非像素级掩码,计算代价更低
发展脉络
目标检测经历了从手工特征到深度学习的重大范式转变。
- 2001:Viola-Jones 检测器,基于 Haar 特征与 AdaBoost,首个可实时运行的人脸检测算法
- 2005:HOG + SVM(Dalal & Triggs),成为行人检测的主流手工特征方法
- 2014:R-CNN(Girshick et al., CVPR 2014),将 CNN 引入目标检测,开创两阶段范式
- 2015:Fast R-CNN 与 Faster R-CNN(Ren、He、Girshick、Sun),引入区域建议网络(RPN),实现端到端训练
- 2016:YOLOv1(Redmon et al., CVPR 2016),将检测视为回归问题,单次前向传播同时完成定位与分类
- 2020 至今:DETR(Facebook AI)用 Transformer 替代锚框与 NMS;YOLO 系列持续迭代至 YOLO11;RT-DETR 实现实时无锚框检测
两阶段检测器
两阶段方法先生成候选区域,再对候选区域分类,精度通常更高,但推理速度较慢。
- 第一阶段(区域建议):生成若干可能包含目标的候选框(Region Proposals)
- 第二阶段(区域分类):对每个候选框提取特征并分类,同时精修边界框坐标
- RPN(Region Proposal Network):Faster R-CNN 的核心创新,与检测头共享卷积特征,避免重复计算
- RoI Align:将不同尺寸的候选区域特征统一为固定尺寸,解决 RoI Pooling 的量化误差问题
- 代表模型演进:R-CNN → Fast R-CNN → Faster R-CNN → Mask R-CNN(额外输出实例分割掩码)
单阶段检测器
单阶段方法跳过显式的区域建议步骤,直接在特征图上密集预测,速度更快,适合实时场景。
- YOLO(You Only Look Once):将图像划分为网格,每个格子直接预测边界框与类别概率,一次前向传播完成检测
- SSD(Single Shot MultiBox Detector):在多尺度特征图上设置不同尺寸锚框,兼顾大小目标
- RetinaNet:引入 Focal Loss,通过降低易分类样本的权重来解决前景/背景极度不平衡问题
- 锚框(Anchor):预先定义的参考框,模型预测相对于锚框的偏移量而非绝对坐标
- YOLO 系列自 YOLOv1(2016)持续演进,已成为工业界实时检测的事实标准
评估指标
目标检测的评测需同时考量定位精度与类别精度,比图像分类复杂。
- IoU(Intersection over Union,交并比):预测框与真实框面积的交集除以并集,衡量定位准确性,常用阈值 0.5
- AP(Average Precision):单类别精确率—召回率曲线下面积,衡量该类别的检测能力
- mAP(mean Average Precision):所有类别 AP 的均值,是 PASCAL VOC、COCO 基准的核心指标
- COCO mAP:在 IoU 从 0.50 到 0.95(步长 0.05)共 10 个阈值上取平均,比 VOC 的单阈值 mAP 更严格
- NMS(Non-Maximum Suppression,非极大值抑制):推理后处理,去除重叠冗余框,保留置信度最高的预测
Transformer 时代
2020 年后,基于注意力机制的检测器开始挑战以卷积+锚框为核心的传统范式。
- DETR(Detection Transformer,Facebook AI,2020):用 Transformer 编解码器直接预测目标集合,彻底去除锚框和 NMS
- 二分图匹配:DETR 以匈牙利算法将预测框与真实框一一对应,实现真正的端到端训练
- Deformable DETR:引入可变形注意力机制,解决 DETR 收敛慢、小目标效果差的缺陷
- RT-DETR(百度,2023):实时无锚框 Transformer 检测器,速度接近 YOLO 同时精度更高
- 注意力机制赋予模型全局感受野,对遮挡、密集场景的处理优于局部卷积
典型应用
目标检测已从实验室走入大规模工业落地,覆盖多个高价值场景。
- 自动驾驶:实时检测行人、车辆、交通标志,是感知模块的核心任务
- 安防监控:异常行为检测、人员计数、车牌识别
- 工业质检:生产线上的缺陷定位,毫秒级响应,替代人工目检
- 医学影像:肿瘤、病灶、解剖结构的自动定位,辅助临床诊断
- 零售与仓储:货架商品识别、无人超市结算、仓库分拣机器人
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「框出图里有什么」
- 「YOLO 那类任务」
- 「检测加分类」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
计算机视觉中的图像分割是什么?
[图像分割](/glossary/semantic-segmentation) 为每个像素分配类别标签。语义分割不区分同类实例;实例分割区分个体;全景分割统一 stuff+thing。是自动驾驶场景理解、医学影像与工业质检的核心技术。
- 初级场景查看详解 →
如何用 AI 给图片自动打标签 / 做图像识别功能?
简单用云视觉 API 或多模态大模型直接问图,定制需标注微调,注意类别定义与置信度阈值。
- 初级编码查看详解 →
手撕代码:实现两个边界框的 IoU
面试里先说公式:IoU = 交集 / 并集;真正容易错的是无重叠时宽高要 clamp 到 0。
- 中级编码高频查看详解 →
手撕代码:实现非极大值抑制(NMS)
面试里先说贪心流程:按分数排序,保留最高分框,再删掉和它 IoU 太高的重复框。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Object Detection」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
