核心要点
能说明 Encoder-Decoder 或纯 Encoder/Decoder 结构
理解 Self-Attention 如何实现全局依赖建模
知道在 NLP、CV(ViT)、多模态中的典型应用
能提及位置编码与 O(n²) 复杂度
简要回答
Transformer 用多头自注意力并行建模序列全局依赖,取代 RNN 的逐步递归;广泛用于机器翻译、大语言模型(GPT)、视觉(ViT)及多模态任务。
标准回答
(Vaswani et al., 2017)以 Self-Attention 为核心,摒弃 RNN 的序列递归,实现并行计算与长程依赖建模。
二、核心机制
- 输入嵌入 + 位置编码(绝对/相对/RoPE)
- 多头自注意力:Q/K/V 投影 → Attention(Q,K,V)=softmax(QK^T/√d)V
- 前馈网络 FFN + 残差连接 + LayerNorm
- Encoder:双向上下文(BERT);Decoder:因果掩码自回归(GPT);Encoder-Decoder:翻译(原始论文)
三、典型场景
| 场景 | 代表模型 | 结构 |
|---|---|---|
| 理解/分类 | BERT | Encoder |
| 文本生成 | GPT 系列 | Decoder |
| 翻译/摘要 | T5, BART | Enc-Dec |
| 视觉 | ViT, Swin | Patch + Attention |
| 多模态 | CLIP, LLaVA | 跨模态 Attention |
| 优势:可扩展性强、易堆叠深层、适合大规模预训练。代价:标准 Attention 复杂度 O(n²),长序列需 Flash Attention、稀疏注意力等优化。详见 Transformer 详解 与 大模型入门。 |
回答思路
【定义】用一句话说清「Transformer 架构如何工作?通常用于哪些场景」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
术语:Transformer、RNN。知识库:Transformer 详解、大模型入门、深度学习基础。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只说 Attention 公式却说不清 Encoder/Decoder 分工;忽视位置编码;声称 Transformer 只能用于 NLP;对 O(n²) 复杂度毫无认知。
追问
追问 1:Transformer 为什么需要位置编码?
Self-Attention 对输入集合置换不变,无法区分 token 顺序。位置编码(正弦、可学习、ALiBi、RoPE)注入顺序信息,使模型感知「第 i 个词」的语义。
追问 2:Encoder 和 Decoder 的 Mask 有何不同?
Encoder 通常无掩码或 padding mask;Decoder 用 causal mask 禁止看到未来 token,保证自回归生成时训练与推理一致。Cross-attention 中 Query 来自 Decoder、K/V 来自 Encoder 输出。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
