简要回答
从训练数据长度、RoPE 位置插值/NTK 外推、Flash Attention 省显存、以及 RAG 外挂记忆四方面扩展有效上下文。
标准回答
训练扩展:直接在长文档上继续预训练/微调。位置编码:RoPE 可通过 Position Interpolation、YaRN 外推到 128K+。Attention 优化:Flash Attention 降显存;Ring Attention 多卡并行;稀疏/线性 Attention 降复杂度。架构:滑动窗口 + 全局 token(Longformer);递归摘要压缩历史。RAG 互补:超长文档用检索而非全塞入窗口。选型看任务:需全文推理用长上下文;FAQ 类用 RAG 更经济。
常见误区
⚠️ 常见踩坑
只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:Lost in the Middle 现象?
题库专题:长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?长上下文中,模型对开头与结尾信息利用更好,中间段落易被忽略。缓解:重排把关键块放首尾、摘要压缩、分块检索只喂相关段、用支持长上下文的模型并做探测评测。
题库延伸:与本追问相关的专题题 → 长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
