核心要点

  • 先按置信度从高到低排序所有候选框。

  • 取出当前最高分框保留,计算它与其余框的 IoU

  • 抑制(剔除)IoU 大于阈值的框,对剩余框重复上述过程直到为空。

  • 易错点:IoU 中交集宽高需与 0 取 max 防止负值;保留索引顺序对应原框。

标准回答

一、先把结论讲清楚

可以先说用途:NMS 是为了把同一个目标周围的一堆重复检测框压成少数几个框

一、流程怎么走?

先按置信度从高到低排序。每一轮拿当前最高分框,把它加入 keep;然后计算它和剩余框的 IoU,把 IoU 大于阈值的框删掉。

二、拆开机制和判断点

剩下的框继续重复这个过程。

二、为什么这是贪心?

它默认最高分框最可信,所以先保留最高分,再抑制和它高度重叠的低分框。这个方法简单、快,也是传统检测器后处理里的常见选择。

**三、实现里容易错什么?

三、补上例子、边界和取舍

**

IoU 的交集宽高要和 0 取 max;返回时最好保留原始索引;多类别检测通常要 按类别分别做 NMS,否则不同类别但位置重叠的框会互相误删。下面用 NumPy 向量化实现:

面试里可以补一个视觉任务例子:手撕代码:实现非极大值抑制NMS 在分类、检测、分割或多模态理解里分别会影响数据增强、模型结构、指标选择和误检漏检分析。这样回答会比单独讲概念更像真实项目经验。

python
import numpy as np

def nms(boxes, scores, iou_thr=0.5):
    # boxes: (N, 4) 每行 [x1, y1, x2, y2];scores: (N,)
    x1, y1, x2, y2 = boxes[:, 0], boxes[:, 1], boxes[:, 2], boxes[:, 3]
    areas = (x2 - x1) * (y2 - y1)
    order = scores.argsort()[::-1]   # 分数从高到低的索引
    keep = []
    while order.size > 0:
        i = order[0]                 # 当前最高分框
        keep.append(i)
        # 计算 i 与其余框的交集
        xx1 = np.maximum(x1[i], x1[order[1:]])
        yy1 = np.maximum(y1[i], y1[order[1:]])
        xx2 = np.minimum(x2[i], x2[order[1:]])
        yy2 = np.minimum(y2[i], y2[order[1:]])
        w = np.maximum(0.0, xx2 - xx1)   # 与 0 取 max 防负
        h = np.maximum(0.0, yy2 - yy1)
        inter = w * h
        iou = inter / (areas[i] + areas[order[1:]] - inter)
        # 仅保留 IoU 不超过阈值的框,进入下一轮
        order = order[1:][iou <= iou_thr]
    return keep

if __name__ == '__main__':
    boxes = np.array([[0,0,10,10],[1,1,11,11],[20,20,30,30]], dtype=float)
    scores = np.array([0.9, 0.8, 0.7])
    print(nms(boxes, scores, 0.5))  # [0, 2],框1 被框0 抑制

常见误区

⚠️ 常见踩坑

误区一:IoU 分母写错。 分母应该是并集,也就是两框面积之和减交集。

误区二:不分类别直接做 NMS。 这样可能把不同类别但位置重叠的真实框删掉。

追问

追问 1复杂度是多少?如何优化?

朴素 NMS 最坏是 O(N²),排序是 O(N log N)。优化可以用 GPU 并行算 IoU、按类别分组处理,或者用 Soft-NMS 减少硬删除带来的漏检。

追问 2NMS 在密集/遮挡场景有什么问题,如何缓解?

硬阈值 NMS 可能把两个真实但重叠很高的目标误删。缓解方法包括 Soft-NMS、DIoU-NMS,或者使用 DETR 这类端到端、弱化 NMS 的检测器。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习