同一笔销售额减少6000元,写成“亏损6000元”,读者对经营状况的理解就会变。
同一份596行订单,同样要求算清销售变化,再做一个能筛选、能下载的中文报表。Gemini 用了约4分45秒,GPT-6 Astra 用了约10分53秒。
主要数字,两边全都算对。
但 Gemini 的分析报告里有一句话让我停了下来:它把“净销售额减少6000元”写成了“净亏损6000元”。
订单表没有商品成本,没有投放成本,也没有任何利润数据。销售少了6000元,并不意味着亏了6000元。这句话如果直接搬进经营汇报,性质就变了。
这次实跑中,Gemini 完成得更快,两边的36个指定数字字段都通过了核验;Astra 的差别体现在对经营结论的表述,以及随报表筛选变化的解释。金额、速度和交付细节,可以分开来看。
任务很普通:店铺为什么少卖了6000元?
两个模型拿到相同的文件和要求,分别独立完成任务。
一张订单表,一张流量表,再加一份统计说明。数据全部虚构,专门用于这轮测试,不包含真实客户信息。
要求分为两部分。
先读数据:比较8月1日至14日与9月1日至14日,去掉重复、未付款和区间外订单,付款金额扣退款,算出销售差额,再拆到各渠道。
然后交付网页:打开就能看中文分析,能选自然搜索、短视频广告、老客回购,导出的 CSV 必须与当前筛选一致。
这类工作,不需要读者了解复杂算法。只要自己做过月报,或者让同事整理过 Excel,就知道结果应该能拿来检查和使用。
先核账,不能被漂亮页面带着走
原始文件有596行。正确清洗会移除8行重复、6行区间外记录、12行未付款或取消记录,留下570笔付款订单。
净销售额从57000元变成51000元,少6000元,下降10.53%。但渠道之间并不是一起下降:
| 渠道 | 8月净销售额 | 9月净销售额 | 变化 |
|---|
| 自然搜索 | 19000元 | 21000元 | +2000元 |
| 短视频广告 | 18000元 | 10000元 | −8000元 |
| 老客回购 | 20000元 | 20000元 | 0元 |
Gemini 和 Astra 都算到了这组结果。
我用本地脚本独立复算,包括总额、排除记录数,以及各渠道的收入、成交数、访问量和转化率,共36个指定数字字段。两边都是36项通过。
对这份数据来说,两边都通过了计算这一关。后续差异需要从分析文字、页面操作和交付文件里继续看。
我实际点了筛选,也下载了文件
这就是 Gemini 做出来的原始页面。

它做了收入、订单数、转化率和退款卡片,也做了渠道表和订单明细,还额外放了一个订单搜索框。
我选择短视频广告后,收入从全店51000元切到该渠道10000元,基期18000元,差额−8000元,明细范围是两期合计160笔订单。
随后点击下载,实际得到 CSV 文件。重新读取这个文件,只有短视频广告订单:8月净额18000元,9月10000元,合计160行。
Astra 的相同操作也通过了。
| 这轮检查 | Gemini 3.8 Flash | GPT-6 Astra |
|---|
| 三份交付文件 | 完成 | 完成 |
| 指定数字字段核对 | 36 / 36 | 36 / 36 |
| 四个渠道范围切换 | 对应数字可切换 | 对应数字可切换 |
| 短视频广告CSV下载 | 160行,金额核对一致 | 160行,金额核对一致 |
| 正式运行结束用时 | 4分45秒 | 10分53秒 |
| 需要人工补充任务或纠正 | 0轮 | 0轮 |
这里的“完成”是真正生成文件,再打开网页检查,不是拿聊天里一段 HTML 当成已经上线的网站。
这轮由 pi 0.84.4 使用本机现有渠道调用 Gemini 3.8 Flash;Astra 使用 Codex CLI 0.154.0,两边设置 high。耗时包括工具与渠道延迟,正式运行前的启动排错单独保留,所以不能把这个时间差直接说成模型本身的推理速度倍数。
算对了数字,仍然可能说错经营结论
Gemini 报告中的两个表述,我不会原样交给经营负责人:
“短视频广告渠道是业绩下滑的唯一亏损源头。”
“净销售额净亏损6000元全部归因于短视频广告。”
这两句都来自本次实际生成的分析文件。
问题出在“亏损”。我们给它的字段,最多能计算销售收入的变化。假设店铺原本盈利20000元,销售少了6000元,仍可能继续盈利;如果广告成本同时大幅下降,利润甚至可能出现另一种变化。没有成本数据,不能判断亏损。
它还把老客回购写成“基本盘极度稳固”。这次两期收入确实都是20000元,但两个14天区间持平,不足以证明长期“极度稳固”。
这些不是数字计算错误,却会影响人怎样理解报告。把“收入减少”写成“亏损”,可能让读者产生完全不同的紧迫感和决策。
Astra 在同一份数据上的表达更克制。它写明短视频广告访问量不变、成交单数减少、转化率下降,并指出具体业务原因还要查。

在这轮里,Astra 更让我放心的部分是结论的措辞,而不只是金额有没有算对。 要拿 AI 结果写经营汇报,这个区别值得花时间看。
还有一个一眼就能看见的小问题
回到 Gemini 的页面截图,下载按钮里的箭头明显偏大,按钮文字被挤成了几行。它可以下载,但一个辅助按钮占了太多视觉空间。
在390像素宽度的检查里,这个问题更突出:页面上方的说明、筛选和大箭头占据了大量空间,要继续往下滑才方便查看指标。

我保留了原始输出,没有为了文章好看先帮它修掉。否则读者看到的就不是第一轮交付结果了。
这版页面还有明确的调整空间:缩小下载图标、减少按钮文字换行,能给收入和变化率留出更多首屏空间。
价格便宜多少,为什么不能直接套在会员上?
先看开发者 API 的标准文字调用价格。
| 每百万token,美元 | GPT-6 Astra | Gemini 3.8 Flash当前优惠价 | Gemini公布的后续常规价 |
|---|
| 普通输入,无缓存 | 10 | 0.75 | 1.50 |
| 输出 | 50 | 3.75 | 7.50 |
Google 标注优惠到2026年12月31日,2027年1月1日起使用后续常规价。Google 官方定价说明、OpenAI 官方定价
用同一组假设算一次:普通输入合计100万token,输出10万token,每次请求都没有触发长上下文加价,不计缓存、搜索和其他工具费用。
Astra 是15美元,Gemini 当前是1.125美元,按公布的后续常规价则是2.25美元。
当前固定用量下,约差13.3倍。这个数字讲的是单位用量费用;本次实跑没有拿到双方同一口径的实际结算账单,因此我不把它写成“这次任务实际省了13.3倍”。
上表对应开发者 API 调用,不能直接换算成 ChatGPT 或 Gemini 的会员月费。个人订阅包含的功能和额度,需要另看套餐。
对于批量处理程序,API单价与每项任务实际消耗的输入、输出、缓存和工具费用共同影响总账单。
官方分数,为什么也没有给出一个简单答案?
| 官方评测 | GPT-6 Astra | Gemini 3.8 Flash |
|---|
| Terminal-Bench 4.0,复杂命令行任务 | 57.9% | 19.1% |
| DeepSWE v1.1,软件工程任务 | 74.1% | 73.8% |
| FrontierCode 1.1 Main,代码评测得分 | 53.3% | 43.6% |
| GPQA Diamond,科学知识与推理 | 96.0% | 95.3% |
来源:OpenAI GPT-6 评测表。Google 自己的模型页将 DeepSWE 写为73.7%,这里保留同一张 OpenAI 表的数字,并注明差异。
同一对模型,在一项测试中差38.8个百分点,在另一项中只差0.3个百分点。对于这轮订单任务,两边又都把36个数字字段算对了。
官方评测覆盖的任务类型不同,本轮报表实测也只对应这一份数据和任务要求。
另外,Gemini 3.8 Flash API 原生接受文字、图片、音频、视频和 PDF,输入上限1048576 token;Astra 模型页列的是文字和图片输入,总上下文1050000 token。围绕视频或录音做整理时,输入方式也会影响工具选择。聊天产品还能搭配其他模型与工具,不能把 API 差异直接扩大成整个产品的能力差异。Google 模型说明、OpenAI 模型说明
ChatGPT 订阅的价格与套餐功能
上面的 API 价格,是开发者按调用量付费的口径。个人使用 ChatGPT 和 Codex,还有按月订阅的方式。
| ChatGPT 套餐 | 官方月费(美元) | Codex 额度档位 | 包含的主要能力 |
|---|
| Plus | 20 | 基础付费额度 | GPT-6 Astra、Codex、文件分析、图片生成、深度研究等 |
| Pro 5X | 100 | Plus 的5倍 | Plus 能力,以及 Pro 推理模型等进阶功能 |
| Pro 20X | 200 | Plus 的20倍 | 与 Pro 5X 相同的核心能力,更高使用额度 |
来源:Codex 官方价格说明、ChatGPT 套餐功能、Pro 两档说明。价格为官网美元月费,税费与地区结算以官方页面为准。5X、20X描述使用额度,不代表每个任务的速度或效果倍数。
一份订阅可以覆盖多种工作。 这次做订单报表用到了 Codex;同一账号还可以处理文档、生成配图、进行深度研究。对于既做表格又写内容、偶尔还要做页面的人,套餐的价值包含这一整组工具,而不只是某一个模型的单次回答。
包含额度内的月度支出更容易安排。 日常在 ChatGPT 和 Codex 的订阅额度内使用,不需要每次按 API 输入、输出另付一次费用;额度用尽后可等待恢复,或按官方提供的方式购买额外 credits。订阅有使用限制,API 账单则单独计算。
套餐之间主要通过额度区分工作量。 Pro 5X 与 Pro 20X 的核心能力相同,差别在于能使用多少。比如同样要反复调整报表、处理多份文件,较高额度为这些连续任务提供了更多使用空间。
截至2026年9月15日,官方暂时停止 Pro 20X 的新订阅与升级,已有 Pro 20X 续费以及 Pro 5X 不受这次暂停影响。当前开通状态
PayForChat 的人民币价格、当前可售套餐和充值服务见 套餐页。PayForChat 为独立第三方服务,模型功能及额度由 OpenAI 提供。
延伸阅读:GPT-6 操作电脑的实际用法、Codex 使用指南。
2026-09-15:加入同任务本地实跑、原始页面截图、36项数字复算与真实CSV下载检查;API费用示例与实际耗时分开说明。