核心要点

  • 静态 vs 动态 Embedding

  • CBOW/Skip-gram:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

  • 下游使用方式:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

简要回答

Word2Vec 预训练固定词表向量,无法处理多义词;BERT/GPT 的 Embedding 随上下文变化,语义表示更精准,是现代 NLP 基础。

标准回答

一、核心回答

Word2Vec(2013) 通过 CBOW/Skip-gram 在共现统计上学词向量,特点是静态表示:同一个词无论上下文如何,向量都一样。

二、关键机制

Transformer Embedding 会经过多层 Attention 得到上下文相关表示,同一个词在不同句子里向量可以不同,因此更适合处理多义词和复杂语义。

三、面试补充

维度上,Word2Vec 通常是 100-300;LLM 隐藏层常见 768-4096+。现代 RAG 更常用 sentence-transformers 或 LLM 表征做文档/查询 Embedding,通常远优于裸 Word2Vec。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1ELMo 的地位?

题库专题:ELMo 有哪些优缺点?它能否做到一词多义?为什么?

ELMo 用双向 LSTM 产上下文相关词向量,是预训练上下文表示的重要里程碑,但已被 Transformer 上下文模型(BERT、GPT)取代;现多作历史对照或轻量场景,主流用 Transformer Embedding。

题库延伸:与本追问相关的专题题 → ELMo 有哪些优缺点?它能否做到一词多义?为什么?

追问 2如何评估 Embedding 质量?

题库专题:文本 Embedding 有哪几种算法?业界有哪些可选的 Embedding 模型?

内在:下游分类/聚类、语义相似度与人类标注相关性。外在:检索 MRR、Recall@K、nDCG;领域用 MTEBbenchmark;生产看 RAG 端到端答案质量,避免只看单一余弦分数。

题库延伸:与本追问相关的专题题 → 文本 Embedding 有哪几种算法?业界有哪些可选的 Embedding 模型?

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习