核心要点

  • 能说明 Encoder-Decoder 或纯 Encoder/Decoder 结构

  • 理解 Self-Attention 如何实现全局依赖建模

  • 知道在 NLP、CV(ViT)、多模态中的典型应用

  • 能提及位置编码与 O(n²) 复杂度

简要回答

Transformer 用多头自注意力并行建模序列全局依赖,取代 RNN 的逐步递归;广泛用于机器翻译、大语言模型(GPT)、视觉(ViT)及多模态任务。

标准回答

一、Transformer

(Vaswani et al., 2017)以 Self-Attention 为核心,摒弃 RNN 的序列递归,实现并行计算长程依赖建模。

二、核心机制

  • 输入嵌入 + 位置编码(绝对/相对/RoPE)
  • 多头自注意力:Q/K/V 投影 → Attention(Q,K,V)=softmax(QK^T/√d)V
  • 前馈网络 FFN + 残差连接 + LayerNorm
  • Encoder:双向上下文(BERT);Decoder:因果掩码自回归(GPT);Encoder-Decoder:翻译(原始论文)

三、典型场景

场景 代表模型 结构
理解/分类 BERT Encoder
文本生成 GPT 系列 Decoder
翻译/摘要 T5, BART Enc-Dec
视觉 ViT, Swin Patch + Attention
多模态 CLIP, LLaVA 跨模态 Attention
优势:可扩展性强、易堆叠深层、适合大规模预训练。代价:标准 Attention 复杂度 O(n²),长序列需 Flash Attention稀疏注意力等优化。详见 Transformer 详解大模型入门

回答思路

  • 【定义】用一句话说清「Transformer 架构如何工作?通常用于哪些场景」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只说 Attention 公式却说不清 Encoder/Decoder 分工;忽视位置编码;声称 Transformer 只能用于 NLP;对 O(n²) 复杂度毫无认知。

追问

追问 1Transformer 为什么需要位置编码?

Self-Attention 对输入集合置换不变,无法区分 token 顺序。位置编码(正弦、可学习、ALiBi、RoPE)注入顺序信息,使模型感知「第 i 个词」的语义。

追问 2Encoder 和 Decoder 的 Mask 有何不同?

Encoder 通常无掩码或 padding mask;Decoder 用 causal mask 禁止看到未来 token,保证自回归生成时训练与推理一致。Cross-attention 中 Query 来自 Decoder、K/V 来自 Encoder 输出。

追问 3Transformer 如何扩展到百万 token 上下文?

采用稀疏注意力(Longformer)、线性注意力、滑动窗口、KV Cache 复用、Ring Attention 分片等技术;硬件上用 Flash Attention 降显存。仍是活跃研究方向。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习