发布于 2026-09-05 · 林启明
直接回答
旗舰定价不必等于平均支出:$1 缓存命中、272K 以内的 prompt 纪律、把例行工作路由给更便宜的目录腿,Astra 的账单就稳了。 这篇指南面向正在比较模型质量、成本、路由策略和生产上线风险的产品与平台团队。
缓存优先
最大的单项杠杆:牌价上缓存命中按每百万 tokens $1/$2 计费,未命中是 $10/$20。系统提示、工具 schema、稳定的文档前缀天然就是缓存的形状。把重复前缀放在请求最前面并保持逐字一致,重复调用就不用再付旗舰输入费率。
能待在陡坎下面就待着
272,000 tokens 边界会让牌价翻倍。把 280K 的 prompt 修到 260K,是 ~7% 的上下文裁剪换来所在层 50% 的费率下降。有时上下文的长尾确实值得付——但这个决定要开着计算器做,而不是看着账单做。
把无聊的一半流量路由走
目录里更便宜的腿——GPT-5.4 mini 与 nano 档、$5/$30 的 GPT-Chat Latest——足以覆盖分类、抽取与日常对话。Astra 留给长上下文合成、计算机操作智能体和困难的尾部。在同一个 OpenAI 兼容端点上,这就是按请求选模型 id,或者做成带项目预算的路由策略。
靠回执盯,不靠感觉
网关上的每笔请求都有逐项回执,项目预算能兜住一个一夜膨胀 40 倍的 prompt。按 key、按模型可见的支出,是旗舰模型账单与旗舰模型惊吓之间的差别。
哪些未经我方验证
文中引用的同族模型价格是发布时点的目录牌价。缓存节省以验证过的完全前缀匹配为前提;gpt-6-astra 尚无一方缓存安全成绩行。
常见问题
用 GPT-6 Astra 最省钱的姿势是什么?
最大化验证缓存命中(牌价 $1/M 输入),尽量把 prompt 控制在 272K 分层边界之内,把 Astra 留给真正需要长上下文或计算机操作的工作。
能给 Astra 的花费设上限吗?
能——网关上的项目预算可以止住失控请求,逐项回执会在事后展示每个模型 id 的支出。