核心要点
Encoder-only vs Decoder-only
预训练目标差异
下游任务适配
简要回答
BERT 用 Masked LM 双向编码,擅长理解类任务;GPT 用因果 LM 从左到右生成,擅长续写、对话和 Agent。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:T5 和 BART 属于哪类?
均为 Encoder-Decoder(seq2seq)架构:T5 把一切 NLP 任务统一为 text-to-text;BART 用去噪自编码预训练再微调生成/理解任务。区别于 GPT 的 Decoder-only。
追问 2:为什么 LLM 时代 BERT 仍有用?
题库专题:如何有效优化和微调 BERT 以应对特定 NLP 任务?分类、NER、检索 rerank、Embedding 等小模型场景成本低、延迟小;BERT 类双塔检索成熟;端侧/合规场景可本地部署。LLM 做理解也行,但未必最经济。
题库延伸:与本追问相关的专题题 → 如何有效优化和微调 BERT 以应对特定 NLP 任务?
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
