核心要点

简要回答

从训练数据长度、RoPE 位置插值/NTK 外推、Flash Attention 省显存、以及 RAG 外挂记忆四方面扩展有效上下文。

标准回答

训练扩展:直接在长文档上继续预训练/微调。位置编码:RoPE 可通过 Position Interpolation、YaRN 外推到 128K+。Attention 优化:Flash Attention 降显存;Ring Attention 多卡并行;稀疏/线性 Attention 降复杂度。架构:滑动窗口 + 全局 token(Longformer);递归摘要压缩历史。RAG 互补:超长文档用检索而非全塞入窗口。选型看任务:需全文推理用长上下文;FAQ 类用 RAG 更经济。

常见误区

⚠️ 常见踩坑

只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1Lost in the Middle 现象?

题库专题:长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?

长上下文中,模型对开头与结尾信息利用更好,中间段落易被忽略。缓解:重排把关键块放首尾、摘要压缩、分块检索只喂相关段、用支持长上下文的模型并做探测评测。

题库延伸:与本追问相关的专题题 → 长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?

追问 2128K 上下文的实际瓶颈?

不只为参数量:Prefill 算力 O(n²)、KV Cache 显存随 n 线性涨、检索噪声增多;中间遗忘、延迟与成本上升。需 RAG/压缩/分层记忆,而非无脑塞满窗口。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习