BM25
BM25经典检索算法
亦作、亦称:Best Matching 25
BM25(Best Matching 25)是经典概率检索排序函数,基于词频(TF)与逆文档频率(IDF)衡量查询与文档相关性,是 Elasticsearch 等搜索引擎的默认算法之一,也常与向量检索组成混合搜索。
算法要点
对查询词在文档中的出现频率做饱和变换(避免词频无限堆砌),并用 IDF 惩罚常见词。参数 k1 控制词频饱和度,b 控制文档长度归一化。
在 RAG 中
纯向量检索擅长语义相似但可能漏掉精确关键词;BM25 补足 SKU、人名、错误码等字面匹配。Hybrid Search 常对 BM25 与向量分数加权融合。
局限
无法处理同义词与跨语言语义;需分词质量支持。现代系统多将 BM25 作为稀疏通道,与稠密嵌入互补而非替代。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「经典检索算法」
- 「基于词频的检索」
- 「常和向量检索结合」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
决策树如何用于自然语言处理任务?
NLP 中常先把文本转为 [TF-IDF](/glossary/tf-idf) 或 n-gram 稀疏向量,再用决策树做情感分类、主题分类、意图识别等。树模型可解释性强,但对高维稀疏文本易过拟合,实践中多与随机森林、XGBoost 或线性模型配合。
- 高级概念查看详解 →
朴素贝叶斯分类器如何用于自然语言处理?
朴素贝叶斯用贝叶斯定理 + 特征条件独立假设做文本分类:用训练集估计 $P(c|w_1...w_n) \propto P(c)\prod P(w_i|c)$。Multinomial NB 配合词频/TF-IDF 广泛用于垃圾邮件过滤与短文本分类,小数据上极快且稳健。
- 高级概念查看详解 →
词性标注(POS)在 NLP 中有何意义?
[词性标注(POS)](/glossary/part-of-speech-tagging) 为每个词分配语法类别(名词、动词等),是句法分析、信息抽取和机器翻译的基础预处理。它能消歧(「Time flies」),并为依存解析提供语言学先验。
- 中级概念查看详解 →
随机森林在自然语言处理中有哪些优势?
随机森林对 [TF-IDF](/glossary/tf-idf)/n-gram 文本特征做集成学习:多棵树在不同样本与特征子集上训练,投票降低方差。适合中小规模文本分类,抗过拟合、可输出特征重要性、无需精细调参。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
Agent 记忆系统(三):向量数据库、知识图谱与分层记忆架构
从工作记忆到长期记忆,理解 AI Agent 如何实现知识的存储、检索、遗忘与更新。涵盖向量数据库、知识图谱、分层记忆架构的设计原则与实战实现。
- 2
Agent 记忆系统(四):向量数据库、知识图谱与记忆检索全景指南
AI Agent 的记忆系统是决定其智能水平的核心组件。本文系统讲解 Agent 记忆体系的完整架构:从短期工作记忆到长期语义记忆,从向量数据库的嵌入检索到知识图谱的关系推理,从记忆压缩策略到遗忘机制,帮助你在构建 Agent 时设计正确的记忆方案。
- 3
知识 Agent 架构与文档 AI 原子组件化:从整块工具到模块化智能
知识 Agent 是 2026 年 AI 领域的重要架构范式——将传统的「整块文档处理工具」拆解为可组合的原子 AI 组件。本文从知识 Agent 的核心概念出发,系统讲解文档 AI 原子组件化的设计原则、架构模式、实战实现,并对比分析主流知识 Agent 框架的优劣,帮助读者构建可扩展的企业级知识管理系统。
外部参考
维基百科:查看「BM25」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
