BM25

BM25

经典检索算法

亦作、亦称:Best Matching 25

BM25(Best Matching 25)是经典概率检索排序函数,基于词频(TF)与逆文档频率(IDF)衡量查询与文档相关性,是 Elasticsearch 等搜索引擎的默认算法之一,也常与向量检索组成混合搜索。

算法要点

对查询词在文档中的出现频率做饱和变换(避免词频无限堆砌),并用 IDF 惩罚常见词。参数 k1 控制词频饱和度,b 控制文档长度归一化。

在 RAG 中

纯向量检索擅长语义相似但可能漏掉精确关键词;BM25 补足 SKU、人名、错误码等字面匹配。Hybrid Search 常对 BM25 与向量分数加权融合。

局限

无法处理同义词与跨语言语义;需分词质量支持。现代系统多将 BM25 作为稀疏通道,与稠密嵌入互补而非替代。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「经典检索算法」
  • 「基于词频的检索」
  • 「常和向量检索结合」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 3 篇文章,帮助深入理解该术语。

  1. 1

    Agent 记忆系统(三):向量数据库、知识图谱与分层记忆架构

    从工作记忆到长期记忆,理解 AI Agent 如何实现知识的存储、检索、遗忘与更新。涵盖向量数据库、知识图谱、分层记忆架构的设计原则与实战实现。

  2. 2

    Agent 记忆系统(四):向量数据库、知识图谱与记忆检索全景指南

    AI Agent 的记忆系统是决定其智能水平的核心组件。本文系统讲解 Agent 记忆体系的完整架构:从短期工作记忆到长期语义记忆,从向量数据库的嵌入检索到知识图谱的关系推理,从记忆压缩策略到遗忘机制,帮助你在构建 Agent 时设计正确的记忆方案。

  3. 3

    知识 Agent 架构与文档 AI 原子组件化:从整块工具到模块化智能

    知识 Agent 是 2026 年 AI 领域的重要架构范式——将传统的「整块文档处理工具」拆解为可组合的原子 AI 组件。本文从知识 Agent 的核心概念出发,系统讲解文档 AI 原子组件化的设计原则、架构模式、实战实现,并对比分析主流知识 Agent 框架的优劣,帮助读者构建可扩展的企业级知识管理系统。

外部参考

维基百科:查看「BM25」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。