發布於 2026-09-05 · 林启明

直接回答

OpenAI 的 MRCR v2 成績給到 GPT-6 Astra 在 512K 之後 96.3% 的檢索率。這對 RAG 與長上下文的取捨意味著什麼——以及它沒覆蓋什麼。 這篇指南面向正在比較模型品質、成本、路由策略和正式環境上線風險的台灣產品與平台團隊。

公布的數字

在 OpenAI 的 MRCR v2 8-needle 評測上,Astra 在 256K-512K 區間拿到 100%,512K-1M 區間 96.3%,而前代 Sol 在同區間大幅下滑。多針檢索——在超大上下文裡找出多個相互獨立的事實——是與真實文件分析工作最接近的基準。

檢索分數沒度量的東西

找針基準考的是找到,不是跨發現做推理。把八份文件合成一個契約立場,比定位八個條款難得多,而已公布的 MRCR 變體沒有為此打分。長上下文召回也修不好過期或錯誤的素材——一百萬 tokens 的壞上下文只會產出自信且讀過很多書的胡說。

RAG 還是長上下文:一條決策規則

多數生產系統最終是混合式:檢索負責提名候選,長上下文模型負責把它們放在一起讀。目錄給 Astra 標的正是這種長上下文與智慧代理混合場景。

  • 知識變化慢且總量在 ~250K tokens 以內:直接塞上下文,上線前記得看一眼分層邊界。
  • 知識變化快或總量超窗:檢索仍然贏,因為重建索引比重付一次 1M token 的 prompt 便宜。
  • 在巨大且穩定的語料上做找針式抽取:這正是 Astra 公布的甜點區——512K 之後 96.3% 就是頭條能力。
  • 單請求成本敏感:用檢索。5K tokens 的檢索 prompt 牌價只要幾分錢;1M tokens 的 prompt 逼近 $20 的高層輸入費率。

哪些未經我方驗證

MRCR 與 OSWorld 數字均為 OpenAI 公布評測。該模型的一方長上下文質量度量在 NextModel 基準表中尚不存在。

FAQ

有了 1M 上下文,我該刪掉 RAG 管線嗎?

很少這麼做。來源穩定且需要並讀的場景用長上下文;知識高頻更新或單請求成本佔主導的場景保留檢索。混合是常見答案。

滿 1M tokens 時檢索有多可靠?

OpenAI 公布的 8-needle MRCR v2 在 512K-1M 區間為 96.3%。那是他們的評測,不是對你文件形態的保證——用你自己的針去抽樣。