把大模型接入生产业务,技术团队最关心的不是发布会 PPT 上吹的跑分,而是接口稳不稳、并发抗不抗得住,以及月底拉出的 Token 账单到底会不会超预算。
xAI 的 Grok API(涵盖最新上线的 grok-4.7 以及 grok-4.6)在定价上给出了非常清晰的策略:500,000 tokens 的大上下文窗口,标准输入为每百万 token $2.00,而一旦命中 Prompt Cache(提示词缓存),输入单价直接拉低 75% 到 $0.50 / 1M tokens。
这篇文章系统拆解 Grok API 的计费结构,并用一个日均 1 万次请求的真实业务模型,帮你算清楚这笔账。
提示:开发者 API 额度与个人包月会员
Grok API 是在开发者后台单独充值绑卡按量扣费的。如果你只是个人平时写代码、查资料,建议直接开通 SuperGrok 包月会员,不需要折腾 API 计费。PayForChat 支持直接通过 UUID 在自己账号开通,微信支付宝即时到账。
核心接口规范与费率标准
根据 xAI 官方开发者文档,Grok 旗舰模型的主要接口指标如下:
| 参数项 | 官方指标 | 说明 |
|---|
| Model ID | grok-4.7 / grok-4.6 | 统一调用标识符,4.7 为 9 月 21 日最新版 |
| 标准输入单价 | $2.00 / 1M tokens | 文本与图片的未缓存输入基准价 |
| 缓存输入单价 | $0.50 / 1M tokens | 命中 Prompt Cache 后的输入价格(直降 75%) |
| 输出单价 | $6.00 / 1M tokens | 包含思考过程、文本回复及代码输出 |
| 上下文容量 | 500,000 tokens | 允许一次性传入全套业务代码或多份大规格文档 |
| 生产并发配额 | 150 req/s,50M tokens/min | 面向生产环境的高并发支持,减少 429 报错 |
| 协议兼容性 | Chat Completions / Responses API | 支持兼容主流生态 SDK |
| 内置工具链 | Web 搜索、X 搜索、代码沙箱执行、函数调用、结构化 JSON 输出 | 支持联网检索与代码执行闭环 |
| 离线 Batch API | 暂不支持 | 目前所有请求均为在线实时处理,暂无半价离线批处理通道 |
注:以上单价为标准短上下文计费基准;当单次输入超过 200K tokens 后有特定的长上下文阶梯费率。
重点理解 Prompt Cache:怎么把输入成本砍掉 75%?
在智能客服、内部知识库(RAG)或代码审查 Agent 中,有大量内容是高度重复的:
- 系统的全局指令(System Prompt)、角色人设与几十行函数的 JSON Schema 说明;
- 固定的工程编码规范或企业产品说明书;
- 连续追问下的历史多轮对话记录。
如果每次提问,都把这几万字作为全新的输入原价计费,账单会非常惊人。
Grok API 提供了自动的 Prompt Cache 机制:当连续多次请求的前半段内容完全一致时,系统会自动将重复前缀识别为缓存命中,该部分的计费单价直接从 $2.00 降到 $0.50。
工程优化技巧:
- 静态内容严格前置:把固定的 System Prompt、API Schema 定义、长期不变的参考资料严格放在请求的最开头;
- 动态变量放在最后:把用户刚刚敲入的提问、动态变化的时间戳或当次代码 Diff 放在最末尾。
只要前缀保持连续稳定,就能持续吃满 75% 的折扣。
一套可复算的成本测算:以日调用 1 万次为例
为了方便工程团队做预算评估,我们设定一个标准的代码审查 Agent 场景进行推演。
1. 业务假设
- 每天请求量:10,000 次调用;
- 单次输入构成:
- 前置系统指令与代码规范(固定不变):3,000 tokens;
- 动态变更代码与提问(不可复用):1,000 tokens;
- 单次总输入量:4,000 tokens;
- 单次输出:平均 500 tokens;
- 计算周期:按每月 30 天算。
2. 方案 A:Prompt 结构未优化(0% 缓存命中)
如果每次请求都把时间戳或随机参数放在头部,导致缓存完全无法命中:
- 每天输入花费:
10,000 次 × 4,000 tokens = 40M tokens
40M × $2.00 = $80.00 / 天
- 每天输出花费:
10,000 次 × 500 tokens = 5M tokens
5M × $6.00 = $30.00 / 天
- 每月总账单(30天):($80.00 + $30.00) × 30 = $3,300.00。
3. 方案 B:规范 Prompt 结构(3,000 tokens 稳定命中缓存)
把 3,000 tokens 的固定前缀规范沉淀在最前面,仅有 1,000 tokens 动态内容走常规计费:
- 每天缓存输入(30M tokens):
30M × $0.50 = $15.00 / 天
- 每天常规输入(10M tokens):
10M × $2.00 = $20.00 / 天
- 每天输出:保持不变,5M × $6.00 = $30.00 / 天;
- 每天合计:$15.00 + $20.00 + $30.00 = $65.00 / 天;
- 每月总账单(30天):$65.00 × 30 = $1,950.00。
结论对比
在同样每天 1 万次请求的业务负载下,仅仅通过规范 Prompt 缓存结构,月度账单从 $3,300 直接降到 $1,950,净省 $1,350(省下 40.9% 的预算)。
架构选型建议与局限
- 适合场景:高频交互型客服、带超长历史的智能体、代码辅助审查、需要调用 X 实时搜索的情报工具。
- 暂不适合场景:
- 离线海量数据清洗:因为暂无半价 Batch API,跑离线千万级冷数据成本不如支持 Batch 的渠道划算;
- 原生音视频直接输入:Grok API 仅支持文本和图片,需要输入两小时会议录音或长视频的场景,应选用原生支持音视频全模态的模型。
再次提醒:如果是普通网页端或客户端的使用者,API 费率和官网包月会员是两码事。日常查资料和写代码更建议直接订阅 SuperGrok 包月套餐,省去复杂的计费管理。
常见问题
Q: Grok 4.6 和 4.7 的 API 单价一样吗?
A: 官方标准计费口径一致,输入均为 $2.00/1M tokens(缓存命中 $0.50),输出均为 $6.00/1M tokens。
Q: Prompt Cache 需要手动调接口开启吗?
A: 不需要。只要前后两次请求的前缀文本完全一致,xAI 服务端会自动匹配并按缓存单价计费。
Q: 买 SuperGrok 会员会赠送 API 调用额度吗?
A: 不会。API 额度与个人包月会员相互独立,需要在 xAI 控制台单独充值或绑卡。
参考来源