标准回答
一、双向 Encoder 的动机
BERT 是纯 Transformer Encoder,目标是学到融合左右上下文的深层双向表示。传统语言模型只能单向预测下一个词,无法同时看到双侧上下文。
二、MLM(Masked LM)
随机选 15% 的 token 做掩码后预测原词,强迫模型用双向上下文还原。为缓解微调阶段不出现 [MASK] 的偏置,这 15% 中:80% 换成 [MASK]、10% 换成随机词、10% 保持原词。
三、NSP(Next Sentence Prediction)
把句对 (A, B) 拼接,用 [CLS] 表示做二分类,判断 B 是否真接在 A 后,目的是学句间关系以利问答、推断。后续 RoBERTa 实验表明 NSP 收益有限甚至有害,将其去除并用更大数据/更长训练反而更好。
四、适用场景
适合理解类任务(文本分类、NER、阅读理解),不擅长自回归文本生成。详见 BERT 预训练模型深度解析。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:误以为 15% 全部替换成 [MASK](实为 80/10/10);把 BERT 当成能像 GPT 那样自回归生成文本的模型。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
