发布于 2026-09-05 · 林启明

直接回答

OpenAI 的 MRCR v2 成绩给到 GPT-6 Astra 在 512K 之后 96.3% 的检索率。这对 RAG 与长上下文的取舍意味着什么——以及它没覆盖什么。 这篇指南面向正在比较模型质量、成本、路由策略和生产上线风险的产品与平台团队。

公布的数字

在 OpenAI 的 MRCR v2 8-needle 评测上,Astra 在 256K-512K 区间拿到 100%,512K-1M 区间 96.3%,而前代 Sol 在同区间大幅下滑。多针检索——在超大上下文里找出多个相互独立的事实——是与真实文档分析工作最接近的基准。

检索分数没度量的东西

找针基准考的是找到,不是跨发现做推理。把八份文档合成一个契约立场,比定位八个条款难得多,而已公布的 MRCR 变体没有为此打分。长上下文召回也修不好过期或错误的素材——一百万 tokens 的坏上下文只会产出自信且读过很多书的胡说。

RAG 还是长上下文:一条决策规则

多数生产系统最终是混合式:检索负责提名候选,长上下文模型负责把它们放在一起读。目录给 Astra 标的正是这种长上下文与智能体混合场景。

  • 知识变化慢且总量在 ~250K tokens 以内:直接塞上下文,上线前记得看一眼分层边界。
  • 知识变化快或总量超窗:检索仍然赢,因为重建索引比重付一次 1M token 的 prompt 便宜。
  • 在巨大且稳定的语料上做找针式抽取:这正是 Astra 公布的甜点区——512K 之后 96.3% 就是头条能力。
  • 单请求成本敏感:用检索。5K tokens 的检索 prompt 牌价只要几分钱;1M tokens 的 prompt 逼近 $20 的高层输入费率。

哪些未经我方验证

MRCR 与 OSWorld 数字均为 OpenAI 公布评测。该模型的一方长上下文质量度量在 NextModel 基准表中尚不存在。

常见问题

有了 1M 上下文,我该删掉 RAG 管线吗?

很少这么做。来源稳定且需要并读的场景用长上下文;知识高频更新或单请求成本占主导的场景保留检索。混合是常见答案。

满 1M tokens 时检索有多可靠?

OpenAI 公布的 8-needle MRCR v2 在 512K-1M 区间为 96.3%。那是他们的评测,不是对你文档形态的保证——用你自己的针去抽样。