上下文窗口的标称容量在两年里从万级 token 增长到百万级。随之出现的判断是:既然能把全部资料一次性放进去,检索这一层就是过渡方案。
这个判断有公开材料支持,也有公开材料反对,且双方引用的都是正经实验。本文的做法是把三份独立材料的实验条件逐一展开,定位分歧的来源。得到的结论是:至少存在一个变量,仅它自身的变化就足以翻转结论方向,而多数对比实验没有单独报告它。
一、三份材料,三个方向
三份材料的核心结论存在显著分歧:
| 材料 | 核心结论 | 方向 |
|---|---|---|
| Chroma《Context Rot》技术报告(2025-07) | 18 个模型全部随输入增长而退化;只给相关片段时的表现显著优于给出完整上下文 | 支持检索 |
| 《Long Context vs. RAG for LLMs》(arXiv:2501.01880) | 长上下文在问答基准上总体优于 RAG | 支持长上下文 |
| 《The Token Tax of Epistemic Accuracy》(arXiv:2606.20898) | 长上下文准确率 73.1%,语义 RAG 65.4%;但前者每查询成本是后者的 26 倍 | 准确率支持长上下文,成本相反 |
仅比对结论,三者无法同时成立。以下逐份展开各自的实验条件。
二、有效容量小于标称容量
2.1 实验设计
Chroma 的技术报告测试了 18 个模型,覆盖四家厂商的前沿与非前沿型号,任务包括三类:大海捞针(NIAH)的扩展版本、对话式问答基准 LongMemEval,以及一个合成的重复词复制任务。
其扩展设计的关键在于把「输入长度」与「任务难度」拆开——传统 NIAH 中长输入往往同时意味着更难的任务,两个变量混在一起。报告的做法是固定待检索信息本身,只改变输入长度,并另外单独调节四个变量:待检索信息与问题的语义相似度、待检索信息与语料的语义相似度、干扰项的数量,以及语料本身的结构。
2.2 关键对比:约 300 token 与约 113k token
对本文命题最直接的证据来自 LongMemEval 部分。报告在 306 个提示上设置了两个条件:一个是完整输入,平均约 113k token;另一个是聚焦输入,只保留与问题相关的片段,平均约 300 token。两个条件包含的有效信息相同。
结果是全部模型族在聚焦条件下的表现都显著更高。启用思考模式后两个条件都有提升,但差距依然存在。
这一对比的意义在于它排除了「信息不足」这个解释:聚焦条件的信息量并不更多,只是无关内容更少。因此可以说,在有效信息不变的前提下,增加无关内容本身伴随着性能损耗。两个条件的体量相差约两个数量级——同样的有效信息被稀释到数百倍体积后,模型对它的利用能力出现了可测量的下降。至于这一损耗的机制,该报告明确表示未做解释。
2.3 三个反直觉的细节
报告中另有三项发现值得单独记录,它们共同说明退化不是简单的「长度惩罚」:
- 语义相似度的影响:待检索信息与问题的相似度越低,性能随长度增长而下降得越快。也就是说,需要模型做一点语义跳跃的检索任务,最先在长上下文中失效。
- 干扰项的影响:加入与答案主题相近但不正确的内容后,性能明显下降,且不同厂商的失败形态不同——部分模型倾向于在不确定时弃答,另一些则给出自信但错误的回答。
- 语料结构的影响:把语料的句子随机打乱、破坏其逻辑连贯性之后,模型的表现反而更好。报告未能解释这一现象的机制。
第三条尤其值得注意:它意味着模型对长文本的处理并不等同于人类式的连贯阅读,因此「把资料整理得更有条理再喂进去」这类直觉性做法,未必朝着有利方向起作用。
2.4 边界
报告自述的局限有三条:它没有解释性能下降背后的机制;待检索信息与语料的相似度实验只在两个主题上做过,作者自述「不足以得出通用结论」;以及报告认为真实的长上下文应用比其测试任务更复杂,因此实际退化应当更严重——最后这一条是外推,不是测量。
此外本文注意到一点,报告未将其列入局限:其评分依赖单一模型作为评判者。该模型与人工判断的一致性经过校准,但评判者本身的系统性偏差无法通过与自身的一致性检验发现。
三、准确率的代价
另一份材料从成本侧切入。该研究在制造业安全培训这一垂直领域,使用一套专家验证过的基准(取自其先前研究),评估了 972 个回答,对比三种检索与上下文策略。
结果是长上下文提示的正确率为 73.1%,语义检索为 65.4%——长上下文领先约 7.7 个百分点。代价是每次查询的成本为语义检索的 26 倍(按每查询美元成本计;若按 token 数计,比值略高于此)。研究将这一现象命名为「认知准确性的 token 税」。
该研究的适用边界需要说明:它使用的是小规格模型(前沿模型的 mini 与 nano 版本),领域单一,样本量为 972 个回答。它能支持的结论是「在该设置下,准确率的边际提升需要以数量级的成本增长换取」,不能直接外推到全尺寸前沿模型或其它领域。
四、检索方法本身是一个变量
长上下文与 RAG 的那份直接对比研究,指向了本文的关键。该研究在过滤掉不需要外部上下文的问题后重新评估,得到的总体结论是长上下文在问答基准上优于 RAG,尤其在百科类问题上。
但同一份研究给出了一个更重要的细分结论:不同检索方法之间的差距很大——基于摘要的检索表现可以与长上下文相当,而基于分块的检索明显落后。此外,在对话类问题与一般性问题上,检索方式具备优势。
换言之,该研究测量的并不是「检索」这一类方法的整体表现,而是它所采用的那几种具体检索实现的表现。当把不同实现分开看时,「长上下文优于检索」这一结论就不再成立于全部条件。
五、分歧的调和:检索质量是缺失的变量
上述分歧中,有一组对比可以在单一研究内部完成,因而不受跨研究差异的干扰。
| 检索实现 | 所属研究 | 相对长上下文的表现 |
|---|---|---|
| 基准数据集给定的相关片段(无损) | Chroma 的聚焦输入条件 | 显著优于完整上下文 |
| 摘要式检索 | 长上下文 vs RAG 研究 | 与长上下文相当 |
| 分块式检索 | 同一研究,同一批模型与任务 | 明显落后于长上下文 |
后两行是关键:它们来自同一份研究、同一批模型、同一组任务,唯一的差异是检索实现方式。在这个受控对比里,「检索不如长上下文」这一结论只在分块式实现上成立;换成摘要式实现,结论就消失了。第一行则给出了这条方向的上界——当检索接近无损时,它反过来显著优于完整上下文。
由此可以得到一个不依赖跨研究比较的结论:多数「长上下文优于检索」的结论,实际测量的是特定检索实现的表现,而非检索这一类方法的表现。而检索实现的质量,在多数对比实验中没有被作为独立变量报告。
至于成本侧那份研究,它的模型规格与领域都与前两份不同,这些差异足以独立解释其结论方向,因此本文不把它排进上述对比,只取其成本量级作为第三节的独立证据。
需要明确这一解读的边界:本节只证明了检索实现方式足以翻转结论方向,没有证明它是唯一或主要的解释变量。任务类型、模型规模、评测方式的差异同样可以解释跨研究的分歧,本文没有排除这些解释。
六、口径失真的一个实例
核对成本侧那份研究时出现了一个与本文主题相关的现象,记录在此。
该研究给出的成本比值是 26 倍。本文在检索这份材料的公开转述时,见到过与原文量级不符的表述。此处不列举具体来源——重点不在某一篇转述写错了,而在于核对的成本:原论文同时给出了两种策略的每查询绝对成本,二者相除即得 26 倍,整个校验是一步除法。
该现象与本站另一篇关于基准可比性的报告所记录的是同一类问题:数据在二手转述中失真,而回溯成本远低于失真造成的判断偏差。凡涉及数量级的成本声称,核对方式是找到给出绝对值的原始材料。
七、工程侧的三种应对
如果有效容量确实小于标称容量,那么工程上的应对不是「扩大窗口」,而是「提高单位 token 的信息密度」。公开的工程实践中有三种做法,均出自同一份厂商工程文档。
7.1 即时检索:存标识符而非存内容
不预先把数据载入上下文,而是维护轻量标识符——文件路径、查询语句、链接——在需要时才加载对应内容。文档中给出的例子是用命令行工具的分段读取来分析大体量数据,全程不把完整数据对象读入上下文。
这一做法与检索的差别在于:检索在提问时一次性决定要哪些内容,即时加载则允许模型在推理过程中反复决定。
7.2 压缩:接近上限时摘要并重启
在上下文接近窗口上限时,对已有内容做摘要,并以该摘要初始化一个新的上下文窗口。文档给出的取舍规则是:保留架构决策、尚未修复的 bug 与实现细节,丢弃冗余的工具输出;重启后再附上最近访问过的五个文件。
这一规则的实质是承认上下文中的内容价值不均等——工具输出的原始文本占据大量 token 但信息密度低,是压缩时的首选丢弃对象。
7.3 隔离:子任务各自持有上下文
把探索性工作交给独立的子任务,各自在隔离的上下文中展开,只把压缩后的结论返回主流程。该文档给出的量级是:子任务可能消耗数万 token 的探索过程,但只返回一千至两千 token 的摘要。
本站另一篇关于编排架构的报告已讨论过这一结构的代价与适用边界,此处不重复。
三种做法的共同点是:都不试图让模型更好地处理长上下文,而是设法让进入上下文的内容更少、密度更高。这与第二节的实验结论方向一致。
八、可推出的判断
判断一:先测检索质量,再选架构
既然更换检索实现足以翻转结论方向,那么他人基准的适用性就取决于其检索实现与你的是否可比——这一点通常无法从论文中读出。可行的替代是在自有数据上测三条线:取一批有标准答案的真实问题,人工标出每个问题所需的相关片段,用这批片段跑一遍得到上限;用现有检索跑一遍得到现状;把完整资料全量送入跑一遍得到长上下文条件下的表现。上限与现状的差即为检索层的改进空间,现状与长上下文的差才是真正的架构选型依据。这一方法的成本集中在人工标注上,问题若需跨段落综合,标注难度会显著上升。
判断二:窗口大小不是采购指标
标称窗口决定的是能装多少,而非能用多少。第二节的证据表明二者差距可观且不随窗口增大而消失。以窗口大小作为选型的主要依据,测量的是一个与实际表现相关性未知的参数。
判断三:成本差异出现在数量级上,需要单独核算
在已知的一组测量中,准确率差距为个位数百分点,成本差距为一个数量级以上。这两个量纲不同,无法直接相抵。可行的做法是把准确率差转换为业务后果——每一百次回答中多错的那几次,其代价是否高于成本的数量级增长。这一换算依赖具体场景,不存在通用答案。
判断四:不要把上下文整理得更「好读」
语料结构被随机打乱后模型表现反而更好这一发现,虽然机制未明,但足以对一类常见做法提出警告:为长上下文精心组织材料的叙述顺序,其收益缺乏证据支持。资源更应投向减少无关内容,而非重排相关内容。
九、局限
- 第五节只证明了检索实现方式足以翻转结论方向,未证明它是跨研究分歧的唯一或主要解释。任务类型、模型规模、评测方式的差异同样具备解释力,本文没有排除它们。
- 「检索质量」在本文中是一个定性概念,缺少统一的量化口径。这意味着本文的结论无法被严格证伪——任何相反的观测都可以被归因于「检索质量不同」。定义该变量的度量方式是本文未解决的问题。
- 三份材料的模型条件各不相同:一份覆盖当期前沿模型,一份使用的是更早一代的模型,一份使用小规格版本且领域高度垂直。其结论向当前全尺寸前沿模型与通用场景的外推均未经验证。
- 本文未做自有实验,全部证据来自公开材料。判断一给出的三条测量方法是从上述材料的实验设计中推导的,其可行性依赖于能否低成本地标注出「最小相关片段」——在需要跨段落综合的复杂查询上,这一标注本身的成本可能很高。
- 「检索质量」在本文中是一个定性变量,缺少统一的度量方式。要让第五节的框架可被严格检验,需要先定义这一变量的量化口径——本文没有解决这个问题。
十、结论
关于长上下文与检索的公开对比给出了方向相反的结论。在一份研究内部的受控对比中——同一批模型、同一组任务,只更换检索实现——「检索不如长上下文」这一结论仅在分块式实现上成立,换成摘要式实现即告消失。另有实验显示,当检索接近无损时,它反过来显著优于完整上下文。因此这类结论的适用范围,取决于其所用的检索实现,而这一条件多数时候不在论文的报告范围内。
对工程选型而言,这意味着可比较的对象不是两种架构,而是自有检索层与无损检索之间的差距。这个差距需要在自有数据上测量,其成本主要在标注环节;但一旦测出,他人基准的适用性问题就不再影响决策。
由此对后续的对比研究提出一条具体建议:把检索质量作为独立变量控制并报告,例如同时给出检索层在该任务上的召回指标,而不是只报告端到端的准确率。在此之前,「长上下文优于检索」一类结论的适用范围无法判定——因为读者无从得知它测的是哪一种检索。本文没有解决这一变量的量化口径问题,这也是上一节列出的局限之一。
参考来源
- Chroma,《Context Rot: How Increasing Input Tokens Impacts LLM Performance》(2025-07-14,作者 Kelly Hong、Anton Troynikov、Jeff Huber):18 个模型的长输入退化测量,含 NIAH 扩展、LongMemEval 的聚焦与完整输入对比、语义相似度与干扰项的影响,及作者自述的局限。
- 《Long Context vs. RAG for LLMs: An Evaluation and Revisits》(arXiv:2501.01880,Xinze Li、Yixin Cao、Yubo Ma、Aixin Sun):过滤无需外部上下文的问题后的重新评估,含摘要式与分块式检索的差异。
- 《The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications》(arXiv:2606.20898,2026-06):972 个回答的评估,长上下文 73.1% 与语义检索 65.4% 的正确率对比,及 26 倍的每查询成本差(论文摘要表述为 per-query token cost,按其给出的每查询美元绝对值相除得 26.2)。
- Anthropic,《Effective context engineering for AI agents》:注意力预算的表述,及即时检索、压缩重启、子任务上下文隔离三种工程做法的具体规则。