核心要点
静态 vs 动态 Embedding
CBOW/Skip-gram:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
下游使用方式:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
标准回答
一、核心回答
Word2Vec(2013) 通过 CBOW/Skip-gram 在共现统计上学词向量,特点是静态表示:同一个词无论上下文如何,向量都一样。
二、关键机制
Transformer Embedding 会经过多层 Attention 得到上下文相关表示,同一个词在不同句子里向量可以不同,因此更适合处理多义词和复杂语义。
三、面试补充
维度上,Word2Vec 通常是 100-300;LLM 隐藏层常见 768-4096+。现代 RAG 更常用 sentence-transformers 或 LLM 表征做文档/查询 Embedding,通常远优于裸 Word2Vec。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:ELMo 的地位?
题库专题:ELMo 有哪些优缺点?它能否做到一词多义?为什么?ELMo 用双向 LSTM 产上下文相关词向量,是预训练上下文表示的重要里程碑,但已被 Transformer 上下文模型(BERT、GPT)取代;现多作历史对照或轻量场景,主流用 Transformer Embedding。
题库延伸:与本追问相关的专题题 → ELMo 有哪些优缺点?它能否做到一词多义?为什么?
追问 2:如何评估 Embedding 质量?
题库专题:文本 Embedding 有哪几种算法?业界有哪些可选的 Embedding 模型?内在:下游分类/聚类、语义相似度与人类标注相关性。外在:检索 MRR、Recall@K、nDCG;领域用 MTEB 等 benchmark;生产看 RAG 端到端答案质量,避免只看单一余弦分数。
题库延伸:与本追问相关的专题题 → 文本 Embedding 有哪几种算法?业界有哪些可选的 Embedding 模型?
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
