核心要点
先按置信度从高到低排序所有候选框。
取出当前最高分框保留,计算它与其余框的 IoU。
抑制(剔除)IoU 大于阈值的框,对剩余框重复上述过程直到为空。
易错点:IoU 中交集宽高需与 0 取 max 防止负值;保留索引顺序对应原框。
标准回答
一、先把结论讲清楚
可以先说用途:NMS 是为了把同一个目标周围的一堆重复检测框压成少数几个框。
一、流程怎么走?
先按置信度从高到低排序。每一轮拿当前最高分框,把它加入 keep;然后计算它和剩余框的 IoU,把 IoU 大于阈值的框删掉。
二、拆开机制和判断点
剩下的框继续重复这个过程。
二、为什么这是贪心?
它默认最高分框最可信,所以先保留最高分,再抑制和它高度重叠的低分框。这个方法简单、快,也是传统检测器后处理里的常见选择。
**三、实现里容易错什么?
三、补上例子、边界和取舍
**
IoU 的交集宽高要和 0 取 max;返回时最好保留原始索引;多类别检测通常要 按类别分别做 NMS,否则不同类别但位置重叠的框会互相误删。下面用 NumPy 向量化实现:
面试里可以补一个视觉任务例子:手撕代码:实现非极大值抑制NMS 在分类、检测、分割或多模态理解里分别会影响数据增强、模型结构、指标选择和误检漏检分析。这样回答会比单独讲概念更像真实项目经验。
import numpy as np
def nms(boxes, scores, iou_thr=0.5):
# boxes: (N, 4) 每行 [x1, y1, x2, y2];scores: (N,)
x1, y1, x2, y2 = boxes[:, 0], boxes[:, 1], boxes[:, 2], boxes[:, 3]
areas = (x2 - x1) * (y2 - y1)
order = scores.argsort()[::-1] # 分数从高到低的索引
keep = []
while order.size > 0:
i = order[0] # 当前最高分框
keep.append(i)
# 计算 i 与其余框的交集
xx1 = np.maximum(x1[i], x1[order[1:]])
yy1 = np.maximum(y1[i], y1[order[1:]])
xx2 = np.minimum(x2[i], x2[order[1:]])
yy2 = np.minimum(y2[i], y2[order[1:]])
w = np.maximum(0.0, xx2 - xx1) # 与 0 取 max 防负
h = np.maximum(0.0, yy2 - yy1)
inter = w * h
iou = inter / (areas[i] + areas[order[1:]] - inter)
# 仅保留 IoU 不超过阈值的框,进入下一轮
order = order[1:][iou <= iou_thr]
return keep
if __name__ == '__main__':
boxes = np.array([[0,0,10,10],[1,1,11,11],[20,20,30,30]], dtype=float)
scores = np.array([0.9, 0.8, 0.7])
print(nms(boxes, scores, 0.5)) # [0, 2],框1 被框0 抑制常见误区
⚠️ 常见踩坑
误区一:IoU 分母写错。 分母应该是并集,也就是两框面积之和减交集。
误区二:不分类别直接做 NMS。 这样可能把不同类别但位置重叠的真实框删掉。
追问
追问 1:复杂度是多少?如何优化?
朴素 NMS 最坏是 O(N²),排序是 O(N log N)。优化可以用 GPU 并行算 IoU、按类别分组处理,或者用 Soft-NMS 减少硬删除带来的漏检。
追问 2:NMS 在密集/遮挡场景有什么问题,如何缓解?
硬阈值 NMS 可能把两个真实但重叠很高的目标误删。缓解方法包括 Soft-NMS、DIoU-NMS,或者使用 DETR 这类端到端、弱化 NMS 的检测器。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
