GPT-6 Astra 于 2026 年 9 月 3 日发布,API 模型 ID 为 gpt-6-astra。开发者最容易算错的不是单价,而是把缓存、长上下文和加速模式混在一起。下面只解决一个问题:一批请求到底会花多少钱。
如果只看结论
- 普通短上下文调用:标准价是输入每百万 Token 10 美元、输出每百万 Token 50 美元;缓存命中输入按每百万 1 美元计。
- 长文档任务:输入超过 272K Token 后,公开价格页列出的长上下文档位为输入 20 美元、输出 75 美元/百万 Token。先切分文档,通常比盲目开启长上下文更省。
- 批处理和实时任务:Batch/Flex 适合不着急的离线任务,Fast 适合交互延迟敏感的任务。前者按公开说明约为标准价的 50%,后者约为 2 倍;最终以控制台账单为准。
想在 ChatGPT 或 Codex 里直接使用模型,不想单独维护 API 余额,可以先看 PayForChat 套餐。套餐价格以页面实时信息为准。
GPT-6 Astra API 单价表
| 计费项 | 标准价(每 1M Token) | 什么时候会遇到 |
|---|
| 输入 Token | $10.00 | 新内容、未命中缓存 |
| 缓存输入 | $1.00 | 相同前缀被复用,且命中缓存 |
| Cache write | $12.50 | 首次写入可复用前缀 |
| 输出 Token | $50.00 | 模型生成的内容 |
| 长上下文输入(>272K) | $20.00 | 单次请求输入超过 272K |
| 长上下文输出(>272K) | $75.00 | 长上下文请求的生成部分 |
标准短上下文价格和模型规格可在 OpenAI GPT-6 Astra 公告 与 开发者模型指南 核对。长上下文、Fast、Batch/Flex 的费率可能随区域和计费策略调整,生产环境应以 OpenAI 控制台为最终账单。
先算一笔能复核的账
假设一个代码审查服务每天处理 20 个仓库,每个仓库产生 200K 输入 Token,模型输出 20K Token。按 30 天计算:
- 月输入:20 × 200K × 30 = 120M Token;
- 月输出:20 × 20K × 30 = 12M Token;
- 输入成本:120 × $10 = $1,200;
- 输出成本:12 × $50 = $600;
- 合计:$1,800/月,还没有算重试和工具调用。
这是标准短上下文、未命中缓存的上限估算。实际随用法浮动。若每个仓库都带相同的系统提示和依赖清单,可以把稳定前缀放到缓存里。假设其中 80% 输入命中缓存:
- 未命中部分:120M × 20% × $10 = $240;
- 命中部分:120M × 80% × $1 = $96;
- 输出仍为:$600;
- 新合计约 $936/月。
缓存能不能命中,取决于前缀是否真正相同、缓存保留策略和 SDK 实现。不要把“发送过相似文本”当作必然命中。
105 万上下文不等于免费装下整本资料
GPT-6 Astra 的上下文窗口是 1,050,000 Token,最大输出为 128,000 Token。窗口变大解决的是“能不能放进去”,不是“放进去后一定更便宜”。
单次请求塞入 600K Token,按长上下文输入 20 美元/百万计算,光输入就是 $12;再生成 20K Token,输出约 $1.50。同样的内容如果能先做检索、只送 120K Token,输入约 $1.20,差距来自上下文长度,不来自模型名称。
比较稳的做法是三段式:
- 先用检索或目录定位相关文件;
- 把稳定的规则、接口定义放在可缓存前缀;
- 只有需要跨文件推理时,才把上下文扩到 272K 以上。
Fast、Batch/Flex 怎么选
- Fast:用户正在等待答案、IDE 里需要即时补全时用。公开说明是按标准价加速计费,约为 2 倍。
- Batch/Flex:夜间跑评测、批量生成文本、迁移旧代码时用。公开说明是标准价的约 50%,但不保证交互级延迟。
- 标准模式:不确定负载特征时先用标准价跑一周,记录 P50/P95 延迟、缓存命中率和每次任务 Token,再决定是否切换。
不要把 Fast 当成“更聪明的模型”,它改变的是排队和速度;不要把 Batch 当成“无限折扣”,它牺牲的是时效性。
接入前的成本控制清单
记录 request_id、input_tokens、cached_tokens、output_tokens
按任务类型拆分预算:交互、批处理、重试
稳定前缀放前面,动态内容放后面
单次请求设置 max_output_tokens,避免失控输出
先用 1% 流量灰度,确认账单字段再扩大
每次请求至少保留四个指标:输入 Token、缓存输入 Token、输出 Token、端到端耗时。只有总美元数,没有这四个分项,很难定位账单突然上涨的原因。
哪些情况不适合直接上 GPT-6 Astra API
小规模脚本、低频问答和能接受排队的离线任务,不一定需要旗舰模型。可以先用更便宜的模型做路由,再把复杂请求交给 Astra。对数据不能离开本地的场景,先确认日志、保留期和企业协议;成本低不代表合规风险低。
PayForChat 是独立第三方订阅服务,不是 OpenAI 官方 API 账户。它适合希望直接使用 ChatGPT/Codex 套餐、而不是自行管理 API Key 和按量账单的用户。
FAQ
Q:GPT-6 Astra API 是按月订阅吗?
A:API 按 Token 用量计费,和 ChatGPT Plus/Pro 订阅是两套账。本文的美元单价是 API 公开价格,不代表 ChatGPT 套餐价格。
Q:缓存输入一定是 $1/百万 Token 吗?
A:这是公开标准价口径。是否命中由前缀一致性和服务端缓存策略决定,实际账单应以控制台明细为准。
Q:105 万上下文能一次上传整套代码库吗?
A:技术上窗口支持很长输入,但还要考虑长上下文费率、检索质量和隐私。先检索再拼接,通常更容易控制成本。
Q:Fast 模式适合批量跑任务吗?
A:只有在延迟比成本更重要时才适合。夜间评测和迁移任务优先看 Batch/Flex。
Q:PayForChat 能代充 GPT-6 Astra API 余额吗?
A:不能把 ChatGPT/Codex 订阅和 OpenAI API 余额混为一谈。PayForChat 支持范围以套餐页和服务说明为准。
参考来源
更新记录
2026-09-05:根据 OpenAI 9 月 3 日发布信息及 9 月 5 日公开价格页,补充缓存、长上下文、Fast、Batch/Flex 的成本口径。