Context Rot(上下文腐烂)
Context Rot窗口再大,真正用上的没多少
亦作、亦称:上下文腐烂 · Context Rot · 长上下文退化
Context Rot(上下文腐烂) 指长上下文窗口中 token 越多、模型对早期信息的检索与推理能力越弱的退化现象——Chroma 2026 研究显示 1M 窗口的实际可用上下文远小于标称值,工程应对是把窗口留给工作记忆、长尾知识交给 RAG。
机制:为什么窗口大不等于记得住
上下文窗口的标称值(如 1M token)只表示模型「能接受」的输入上限,不等于「能有效使用」的上限。随着 token 数量增加,早期信息在注意力计算中被后文稀释,检索与推理能力逐渐降级。
Chroma 2026 年研究(particula.tech)指出:即使 1M 窗口无额外成本,实际可用上下文也远小于标称值——「装得下」和「用得上」是两回事。
工程应对:窗口只放工作记忆
研究建议:1M 窗口内仅放置工作记忆——最近几轮对话、活跃文档、即时工具调用结果;长尾知识使用 RAG,按需检索注入而非一次性塞满窗口。
这改变了长上下文时代的 Prompt 设计:不是把能放的都放进去,而是按访问频率分层。
与相关概念的边界
与 lost-in-the-middle(位置效应)不同,context rot 是随 token 总量增长的系统性退化;与 attention-drift(推测解码草稿链的注意力偏离)同属「注意力质量」问题,但作用域不同——前者是推理时对早期上下文的整体衰减,后者是草稿模型与目标模型的分布失配。
两者都提醒:标称容量不等于有效容量,评测必须用长距离检索任务而非只测能装多少。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「窗口再大,真正用上的没多少」
- 「上下文越长越记不住前面」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级系统设计查看详解 →
基准污染诊断:当 SWE-bench Verified 得分异常高但实际能力不匹配时,如何系统性诊断并调整评估策略?
OpenAI SWE-bench Verified 审计发现 59.4% 任务存在缺陷,前沿模型被检测到从训练数据中召回答案(adwaitx.com 2026-02 技术分析)。当模型在基准上得分异常高(如 80%+)但实际能力不匹配时,候选人需要展示三条独立诊断路径(n-gram overlap 精确重叠、embedding similarity 语义重叠、ablation study 因果归因)的交叉验证能力,以及污染确认后从「单一基准分数」转向「基准组合 + 私有评测 + 过程评估」的评估策略重构能力。本题区分「会跑 benchmark」与「理解 benchmark 为什么可信」的候选人。
- 高级概念查看详解 →
在 MoE 模型的大规模部署中,Expert Parallelism 面临哪些工程挑战?请从负载均衡、通信开销、故障恢复三个维度分析。
Expert Parallelism 把 MoE 专家分布到多 GPU 以突破单卡显存上限,但 Top-K 路由导致负载不均、All-to-All 通信跨节点成为瓶颈、Expert 级 checkpoint 与弹性恢复比 Dense 模型更复杂。
- 中级概念查看详解 →
Claude Opus 5 如何在降低成本的同时提升安全性?「guardrails 激活频率降低 85%」意味着什么?
考察候选人对前沿模型「安全-可用性平衡」的理解:以 2026 年 7 月发布的 Claude Opus 5 为例,解读「guardrails 激活频率较 Fable 5 降低 85%」的真实含义、过度拒绝(over-refusal)问题,以及为什么「更少误拦」与「更安全」可以同时成立。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
- 1
百万Token上下文时代的开发场景落地指南
GPT-5.5 与 MiniMax M3 均支持百万级 Token 上下文窗口,AI 从片段理解进化为全局分析。本文系统梳理代码仓库分析、长文档理解、RAG 架构重设计三大核心场景,给出可直接落地的工程方案与性能基准数据。
- 2
GLM-5.2 深度技术解析:智谱百万上下文旗舰模型的架构创新与工程实践
2026 年 6 月 17 日,智谱发布并开源新一代旗舰大模型 GLM-5.2。该模型以 744B 总参数(40B 激活)的 MoE 架构,实现了稳定可用的 100 万 token 上下文窗口,在 SWE-bench Pro、FrontierSWE 等基准上逼近 Claude Opus 4.8,API 成本仅为 GPT-5.5 的六分之一。本文深度解析 GLM-5.2 的 IndexShare、KVShare、LayerSplit、HiSparse 四大核心架构创新,以及从 128K 到 1M 的工程实现路径。
- 3
RAG 2026:从混合搜索到检索栈专用化的演进
2026 年年中,RAG 的瓶颈正在从模型层下移到检索层:混合搜索(BM25 + 稠密向量)以可验证的精度增益成为默认检索架构,而向量检索的计算负载又把问题推向硬件——Dnotitia 在 FMS 2026 发布首颗 VDPU(Vector Data Processing Unit)芯片并获 AI Application Award,宣称把宿主 CPU 利用率从 70-90% 压到接近 0。与此同时,arXiv 论文 TabooRAG 揭示了检索栈的另一个盲区:对齐同质性让安全对齐本身成为可迁移的拒绝服务攻击面,9 个主流 LLM 上的阻断攻击成功率达 59.1%-77.4%。本文沿「为什么检索成为瓶颈 → 混合搜索的增益与代价 → 检索硬件专用化机制 → 攻击面边界 → 企业选型决策」五步,给出 RAG 检索栈 2026 年的完整演进图景。
外部参考
维基百科:查看「Context Rot」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
