标准回答
一、先给出结论和背景
- 本质:Embedding 就是把一段文本喂给模型,输出一串固定长度的数字(向量)。关键性质是「语义相近 → 向量相近」,所以判断两段话意思像不像,就变成算两个向量的距离/余弦相似度。
- 搜相似:语义搜索:传统关键词搜「退货」搜不到只写「退款流程」的文档;用 embedding 把所有文档和查询都转向量,按相似度排序,就能命中同义、近义内容。这是 RAG 里检索的核心步骤——先用向量召回相关片段,再喂给大模型生成答案。
二、拆开关键步骤和判断点
- 找重复:去重与聚类:把一批用户反馈/新闻转向量,相似度高的归一类,可以做内容去重、话题聚类、找近似重复工单。
- 做分类与推荐:把文本向量丢给一个简单分类器做意图识别;或拿「用户看过的内容向量」找最相近的物料做相似推荐。
三、补上落地边界和取舍
- 异常检测:正常样本向量聚成一团,离群的向量就是异常,可用于发现异常文本/行为。
面试里可以补一句:Embedding向量在实际应用里能用来做什么 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:别把 embedding 当成「能回答问题的模型」——它只负责把内容变成可比较的向量,回答还得靠检索后接大模型;也别忽略不同任务要选合适的 embedding 模型和相似度阈值。
追问
追问 1:Embedding 和直接用关键词搜索有什么区别?
关键词搜靠字面匹配,换个说法就搜不到;embedding 比的是语义,能命中同义、近义表达。实际中常把两者混合(hybrid search):关键词保证精确命中,向量保证语义召回。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
