发布于 2026-09-05 · 林启明
直接回答
GPT-6 Astra 牌价每百万 $10/$50——直到你的 prompt 越过 272K tokens,费率翻倍到 $20/$75。算清楚这笔账,以及缓存什么时候救你。 这篇指南面向正在比较模型质量、成本、路由策略和生产上线风险的产品与平台团队。
两层费率
目录牌价:prompt 不超过 272,000 tokens 时,每百万 tokens 输入 $10 / 输出 $50(美元),缓存命中 $1;越过这条线,该层费率为 $20/$75、缓存命中 $2。陡坎按 prompt 大小划分:上下文越大,所在层的每 token 牌价越高。
算例
一份 100K tokens 的文档提交一次:低层输入约 $1.00,外加按 $50/M 计的输出。一份 500K tokens 的代码切片:高层输入约 $10.00(500K/1M × $20),这还没算输出。接近 1M tokens 的 prompt 单次输入就要奔 $20 去了。在这种费率下,缓存成了大杠杆:经验证的重复前缀按 $1/$2 计费,而不是 $10/$20。
陡坎什么时候会改变你的架构
在 250K 到 300K tokens 这个区间附近,把上下文修剪到边界以下可以把输入费率砍半。有时这是笔坏买卖——长上下文检索质量正是你选 Astra 的理由——但这应该是个决策,而不是事故。把 prompt 大小当成本指标盯,而不只是能力指标。
下手前先比价
GPT-5.6 Sol 用 $5/$30 的平价覆盖同样的 1,050,000 窗口。用成本计算器估算你真实的月度配比,并随时核对定价页——目录牌价会动。
哪些未经我方验证
本文全部费率来自 NextModel 目录牌价(与 OpenAI 发布时的 API 定价一致)。缓存命中计费以验证过的完全前缀匹配为前提;该模型尚无一方缓存安全成绩行。
常见问题
272K 分层是对整个 prompt 收,还是只对超出部分收?
目录按 prompt 大小分列各层费率;请把任何超过 272K prompt tokens 的请求当作按 $20/$75 层计费来预算。边界情形的账单语义以你的请求回执为准——每笔调用都有逐项清单。
GPT-6 Astra 缓存命中多少钱?
牌价:低层每百万输入 tokens $1,高层 $2,对比未命中的 $10 和 $20。重复的系统提示与文档前缀正是它发挥作用的地方。