Cosine Similarity(余弦相似度)
Cosine Similarity向量夹角余弦
亦作、亦称:余弦相似度 · Cosine Distance
余弦相似度通过两向量夹角余弦值衡量方向相似性,取值 [-1, 1],对向量长度不敏感,是文本嵌入检索与推荐系统中最常用的相似度度量之一。
定义
cos(θ) = (A·B) / (||A|| ||B||)。当向量已 L2 归一化时,余弦相似度等价于点积,便于 ANN 索引加速。
与嵌入检索
Sentence-BERT 等模型输出的嵌入常用余弦相似度排序 Top-K 文档。注意:未归一化时欧氏距离与余弦排序可能不一致。
其他度量
点积适合未归一化且重视模长的场景;欧氏距离关注绝对位置。选型需与训练目标(对比学习损失)一致。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「向量夹角余弦」
- 「衡量语义相似度」
- 「值域 -1 到 1」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
决策树如何用于自然语言处理任务?
NLP 中常先把文本转为 [TF-IDF](/glossary/tf-idf) 或 n-gram 稀疏向量,再用决策树做情感分类、主题分类、意图识别等。树模型可解释性强,但对高维稀疏文本易过拟合,实践中多与随机森林、XGBoost 或线性模型配合。
- 高级概念查看详解 →
朴素贝叶斯分类器如何用于自然语言处理?
朴素贝叶斯用贝叶斯定理 + 特征条件独立假设做文本分类:用训练集估计 $P(c|w_1...w_n) \propto P(c)\prod P(w_i|c)$。Multinomial NB 配合词频/TF-IDF 广泛用于垃圾邮件过滤与短文本分类,小数据上极快且稳健。
- 高级概念查看详解 →
词性标注(POS)在 NLP 中有何意义?
[词性标注(POS)](/glossary/part-of-speech-tagging) 为每个词分配语法类别(名词、动词等),是句法分析、信息抽取和机器翻译的基础预处理。它能消歧(「Time flies」),并为依存解析提供语言学先验。
- 中级概念查看详解 →
随机森林在自然语言处理中有哪些优势?
随机森林对 [TF-IDF](/glossary/tf-idf)/n-gram 文本特征做集成学习:多棵树在不同样本与特征子集上训练,投票降低方差。适合中小规模文本分类,抗过拟合、可输出特征重要性、无需精细调参。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Cosine Similarity」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
