简要回答
从训练数据长度、RoPE 位置插值/NTK 外推、Flash Attention 省显存、以及 RAG 外挂记忆四方面扩展有效上下文。
标准回答
一、先把结论讲清楚
训练扩展:直接在长文档上继续预训练/微调。位置编码:RoPE 可通过 Position Interpolation、YaRN 外推到 128K+。Attention 优化:Flash Attention 降显存;
二、拆开机制和判断点
Ring Attention 多卡并行;稀疏/线性 Attention 降复杂度。架构:滑动窗口 + 全局 token(Longformer);递归摘要压缩历史。RAG 互补:超长文档用检索而非全塞入窗口。
三、补上例子、边界和取舍
选型看任务:需全文推理用长上下文;FAQ 类用 RAG 更经济。
面试里可以补一句:扩展 LLM 的上下文窗口 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:Lost in the Middle 现象?
题库专题:长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?长上下文中,模型对开头与结尾信息利用更好,中间段落易被忽略。缓解:重排把关键块放首尾、摘要压缩、分块检索只喂相关段、用支持长上下文的模型并做探测评测。
题库延伸:与本追问相关的专题题 → 长上下文的「迷失在中间」(Lost in the Middle)是什么?如何缓解?
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
