2026 年 9 月 22 日,OpenAI 发布了 GPT-6 Sol,Anthropic 同一天发布了 Claude Opus 5.5。两家公告里都没有拿对方这款新模型做比较:OpenAI 比的是上一代 Claude Opus 5,Anthropic 比的是 GPT-6 Astra 和 GPT-5.6 Sol。
这篇只用两家官网公布的数字。能放在一起比的放一起,口径不同的单独标出来,没公布的写「未公布」,不拿第三方榜单补。
核心结论
- 跑自动化流程、按量调 API:GPT-6 Sol 单价更低(输入输出单价均为 Opus 5.5 的一半)。在 AutomationBench 上,两者 xhigh 档相差 1.2 分,Sol 的单任务成本约为 Opus 5.5 的三分之一。
- 终端任务与一次性代码合并率:Opus 5.5 表现更突出。在 FrontierCode 默认档(medium)下,Opus 5.5 比 Sol 高 8.7 个百分点;Terminal-Bench 4.0 测试中 Opus 5.5 为 66.4%(OpenAI 未公布 Sol 的该项数据)。
- 日常订阅与综合搭配:ChatGPT Plus 包含 Sol 与 Astra。在处理常规任务时调用 Sol 节省额度,复杂场景可切换至 Astra。Astra 在 FrontierCode 和 AutomationBench 上的分数与 Opus 5.5 差异在 1 个百分点左右。
一份 Plus 订阅,Sol 和 Astra 都能用GPT-6 Sol、Astra、Luna 都在 ChatGPT Work 和 Codex 里,Plus 起就能选。没有外卡可以走代充,不需要账号密码。查看 Plus / Pro 套餐
先分清定位:这两款不在同一个价位
| GPT-6 Sol | Claude Opus 5.5 |
|---|
| 在自家的位置 | GPT-6 家族中间档,Astra 之下、Luna 之上 | Claude 5.5 家族第一款 |
| 官方怎么说 | 把 Astra 的能力下放到更快、更便宜的模型 | 多数工作达到 Fable 5.1 水平,运行成本比 Opus 5 低 40% |
| 自家更高一档 | GPT-6 Astra(API $10 / $50) | Claude Fable 5.1(API $10 / $50) |
| API 单价(输入 / 输出,每百万 token) | $2 / $10 | $4 / $20 |
OpenAI 官方说明中,GPT-6 Astra 仍作为其综合能力上限,Sol 主打性价比。Opus 5.5 的定价处于 Sol 与 Astra 之间,Anthropic 官方对比表也将 Opus 5.5 与 Astra 并列参照。下文各项测试与价格数据反映了两者的具体定位差异。
规格对比
| 项目 | GPT-6 Sol | Claude Opus 5.5 |
|---|
| 发布日期 | 2026-09-22 | 2026-09-22 |
| API 模型 ID | gpt-6-sol | claude-opus-5-5 |
| 上下文窗口 | 1M tokens | 1M tokens,默认开放,不需要 beta 头 |
| 最大输出 | 128K tokens | 128K tokens,Batch API 测试版可到 300K |
| 知识截止 | 2026 年 4 月 20 日 | 2026 年 6 月 |
| 推理档位 | none / low / medium(默认)/ high / xhigh / max | low / medium(默认)/ high / xhigh / max |
| 能否关掉推理 | 能,设成 none | 不能,自适应思考常开 |
Opus 5.5 的知识截止时间晚一到两个月。Sol 提供了 none 档,不需要额外推理的请求可以直接关闭思考;Opus 5.5 采用常开自适应思考模式,不支持手动完全关闭。
API 价格:单价差一倍,缓存读取一样
| 每百万 token | GPT-6 Sol | Claude Opus 5.5 |
|---|
| 输入 | $2 | $4 |
| 输出 | $10 | $20 |
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5(5 分钟)/ $8(1 小时) |
| 长上下文 | 输入超过 272K token,整个请求的输入和缓存按 2 倍、输出按 1.5 倍计 | 公告未提加价 |
| 快速模式 | 公告未列 | $8 / $40,速度最高 2.5 倍 |
- 缓存读取单价一致:Anthropic 官方指出缓存读取占 Agent 与代码任务成本的大头。缓存命中率较高时,两者的实际开销差距小于基础单价呈现的倍数。
- Sol 超长上下文阶梯计费:单次输入超过 272K tokens 时,输入及缓存部分按 2 倍计费,输出按 1.5 倍计费。频繁传输超长上下文时需考虑这一阶梯差异。
- 两方相较上代均有降价:Sol 基础单价比 GPT-5.6 Sol 推广价降低 50%;Opus 5.5 基础单价比 Opus 5 降低 20%,缓存读取降低 60%。
官方跑分①:两家都公布了的两项
FrontierCode v1.1 和 AutomationBench 在两家公告里都有。两家图表里 GPT 系列的分数完全一致,Claude 系列只有个别数据点差 0.1 到 3 个点,是同一套成绩,可以放在一起看。
下面按推理档位列的数字,是从两家公告图表的数据点逐个读出来的,公告正文只写了其中几个。
FrontierCode v1.1 Main:写出能直接合并的代码
FrontierCode 由 Cognition 维护。除了代码对不对,还看测试质量、改动范围、代码风格、是否符合代码库规范,也就是能不能直接合并。
| 推理档位 | GPT-6 Sol 得分 | Sol 每任务成本 | Opus 5.5 得分 | Opus 5.5 每任务成本 |
|---|
| low | 37.3% | $0.45 | 47.3% | $0.40 |
| medium(两家默认) | 45.9% | $0.80 | 54.6% | $0.80 |
| high | 47.7% | $1.08 | 54.0% | $1.09 |
| xhigh | 48.4% | $1.37 | 51.4% | $2.25 |
| max | 49.3% | $2.14 | 54.4% | $6.19 |
- 默认档位下两者的单任务成本均为 $0.80 左右,Opus 5.5 得分高 8.7 个百分点。
- Opus 5.5 在 low 档得分为 47.3%,接近 Sol 在 max 档的 49.3%,两档单任务成本分别为 $0.40 与 $2.14。
- Opus 5.5 在 max 档得分为 54.4%,与 medium 档的 54.6% 接近,单任务成本增加至 $6.19。
- 两方对同批测试点的成本估算差异在 8% 以内。
AutomationBench:跨应用的业务流程
AutomationBench 由 Zapier 出,让智能体用 47 个工具,跑完销售、市场、运营、客服、财务、人事的端到端流程。
| 推理档位 | GPT-6 Sol 得分 | Sol 每任务成本 | Opus 5.5 得分 | Opus 5.5 每任务成本 |
|---|
| low | 21.2% | $0.19 | 23.3% | $0.50 |
| medium | 26.9% | $0.21 | 28.6% | $0.64 |
| high | 31.2% | $0.24 | 32.0% | $0.70 |
| xhigh | 33.2% | $0.27 | 34.4% | $0.86 |
| max | 32.0% | $0.34 | 40.0% | $1.37 |
- 从 low 到 xhigh 档位,Opus 5.5 各档得分高出 0.8 至 2.1 个百分点,单任务成本约为 Sol 的 2.6 至 3.2 倍。
- 在 max 档位,Opus 5.5 得分为 40.0%,Sol 在 xhigh 档位最高得分为 33.2%。
- 该项测试两方在单任务成本的计算口径上差异较大(同一测试点数据相差约 2.4 倍),成本仅供量级参考。
- Anthropic 标注:Opus 5.5 该组成绩基于 Zapier 抢先体验版测试,未开启降级回退,受安全限制拦截的任务计为未通过。
官方跑分②:口径不同,别直接比
OSWorld 2.0(系统与桌面操作)
OpenAI 公布的是 offline 集(v2026.08.08)测试成绩:Sol 在 xhigh 档为 60.5%,max 档为 64.4%;同图表中 Claude Opus 5(max)为 70.2%,Astra 最高为 73.5%。
Anthropic 公布的 Opus 5.5 测试成绩为 81.8%(partial),同测试中 Claude Opus 5 为 74.0%。两家测试环境与基准版本存在差异,数据不作直接横向对比。
官方跑分③:只有一家公布的项目
| 评测 | 考什么 | 成绩 |
|---|
| GPT-6 Sol(OpenAI 公布) | | |
| Agents' Last Exam V1 | 55 个细分行业的长流程专业任务 | 56.4%(max) |
| DeepSWE v1.1 | 真实代码库里的长周期工程任务 | 68.8%(max) |
| 内部事实性评测 | 用户标记过事实错误的真实对话,越低越好 | 错误率 4.5%(xhigh),GPT-5.6 Sol 同档 8.4% |
| Claude Opus 5.5(Anthropic 公布) | | |
| Terminal-Bench 4.0 | 命令行里的多步骤专业任务 | 66.4%(xhigh) |
| CursorBench 4.0 | 智能体编程 | 57.8% |
| GDPval-AA v2.1 | 44 个职业的真实工作 | 1846 Elo |
| Humanity's Last Exam | 跨学科难题(带工具) | 67.7% |
| Terminal-Bench-Science 0.1 | 科研软件操作 | 58.7% |
| Chartography | 图表识别(带工具) | 89.0% |
换两把尺子:两家都比过的模型
两家各自拿来做参照的模型里,有两个重合:上一代 Claude Opus 5,和 GPT-6 Astra。
尺子一:Claude Opus 5(数据全部来自 OpenAI 图表)
| 评测 | GPT-6 Sol 最高分 | Claude Opus 5 最高分 |
|---|
| FrontierCode v1.1 | 49.3% | 53.4%(medium) |
| DeepSWE v1.1 | 68.8% | 73.7%(max) |
| OSWorld 2.0 offline | 64.4% | 70.2%(max) |
| AutomationBench | 33.2% | 26.9%(max) |
| Agents' Last Exam | 56.4% | 55.9%(high) |
OpenAI 图表公布的数据显示,在以上 5 项测试中,Opus 5 在 3 项上的峰值分数高于 Sol。在 DeepSWE 任务中,Sol max 档单任务成本为 $2.74,Opus 5 max 档为 $11.84。
Anthropic 官方公布的 Opus 5.5 较 Opus 5 提升幅度为:Terminal-Bench 4.0 从 52.3% 提升至 66.4%,FrontierCode 从 48.0% 提升至 54.4%,AutomationBench 从 26.9% 提升至 40.0%,OSWorld 2.0 从 74.0% 提升至 81.8%。
尺子二:GPT-6 Astra
| 评测 | GPT-6 Sol | GPT-6 Astra | Claude Opus 5.5 |
|---|
| FrontierCode v1.1 | 49.3% | 53.3% | 54.4% |
| AutomationBench | 33.2% | 41.4% | 40.0% |
| Terminal-Bench 4.0 | 未公布 | 57.9% | 66.4% |
| GDPval-AA v2.1 | 未公布 | 1542 | 1846 |
| Humanity's Last Exam(带工具) | 未公布 | 57.2% | 67.7% |
| Terminal-Bench-Science 0.1 | 未公布 | 64.6% | 58.7% |
前两行 Sol 与 Astra 数据来自 OpenAI 公告,后四行数据及 Opus 5.5 成绩来自 Anthropic 公告(其中 Terminal-Bench 的 Astra 成绩为 Anthropic 引用自 OpenAI 公布数据)。Astra 的完整跑分见 GPT-6 Astra 发布解读。
测试数据显示,Opus 5.5 在其中 4 项指标上高于 Astra。Sol 在 OpenAI 各项公布指标中均低于 Astra。两者的主要区别体现在调用成本与能力上限的平衡上。Astra 与 Claude Fable 5.1 在同一任务上的实测对比,见 GPT-6 Astra vs Claude Fable 5.1。
算一笔账:同样的任务量,API 花多少
示例:一个团队每天用 API 跑 200 个 FrontierCode 难度的编码任务,再跑 200 个 AutomationBench 类型的业务流程任务。成本和通过率直接取两家官方图表,只是示意量级,实际随任务、缓存命中和重试浮动。
| GPT-6 Sol | Claude Opus 5.5 |
|---|
| 编码 200 个(medium) | $160/天,约 92 个通过 | $160/天,约 109 个通过 |
| 每个通过的编码任务 | $1.74 | $1.47 |
| 业务流程 200 个(xhigh) | $54/天,约 66 个通过 | $172/天,约 69 个通过 |
| 每个通过的流程任务 | $0.81 | $2.50 |
| 30 天合计 | 约 $6,420 | 约 $9,960 |
在编码任务示例中,Opus 5.5 单价较高,但单任务完成使用的 token 较少,折算每个通过任务的成本低 $0.27;在业务流程自动化示例中,Sol 的调用成本更低。实际开销需结合任务复杂度与缓存情况测算。
ChatGPT Plus 官方月费为 $20,包含 Work 与 Codex 额度。Claude Pro 官方月费同为 $20,提供更高用量的 Max 档位。
在哪能用
| GPT-6 Sol | Claude Opus 5.5 |
|---|
| 普通聊天 | 标准 Chat 暂时选不到 | Claude 应用 |
| 工作 / 智能体模式 | ChatGPT Work | Cowork |
| 编程 | Codex | Claude Code |
| 个人订阅 | Plus、Pro;Free / Go 只能在桌面版用 Luna | Pro、Max(公告未提 Free) |
| 团队订阅 | Business、Enterprise、Edu | Team、Enterprise |
| API 与云 | OpenAI API | Claude API、AWS、Google Cloud、Microsoft Azure |
| 上线同期 | ChatGPT 当天分批推送 | 上调 Pro、Max、Team、按席位 Enterprise 的 5 小时额度,送一次能存着用的额度重置 |
GPT-6 Sol 目前只在 ChatGPT Work 和 Codex 里。只在网页上聊天的话,模型选择器里看不到它,这是正常的。
其他维度
事实准确。 OpenAI 用一批「用户标记过事实错误」的真实对话做内部评测,Sol 的错误率约为 GPT-5.6 Sol 的一半(xhigh 档 4.5% 对 8.4%),接近 Astra 的 3.9%-4.0%。Anthropic 的内部测试是让模型只靠检索写季度业绩报告,自动核对每个数字和引语,Opus 5.5 的 18 份里有 16 份过线,Fable 5.1 和 Opus 5 一份都没过。两项测试不同,不能互比。
写作风格。 两家这次改的是同一个方向:结论放前面,少用行话,回答更短。OpenAI 放了一段网站改版回复的前后对比,Anthropic 放了一段解释 bug 的前后对比。
速度。 Anthropic 说 Opus 5.5 的输出速度比 Opus 5 快 30% 以上。OpenAI 没给 Sol 的速度数字。
安全机制。 Opus 5.5 上线就带着和 Fable 5.1 同级的防护,大部分网络安全任务会转给 Opus 4.8 处理,被生物安全防护挡住的研究要申请 Anthropic 的生命科学验证计划。做安全研究的用户会碰到这层回退。Anthropic 的新测试里,Opus 5.5 试图越出边界的次数比 Opus 5 少约 85%。OpenAI 说 Sol 在对齐评测里比 GPT-5.6 同档有进步,编码任务里谎报工作的比例更低,公告没提类似的任务改道机制。
接入改动。
- Opus 5.5:思考不能关,强制调用工具会报错,
max_tokens 包含思考部分(xhigh、max 档官方建议从 64K 起设)。从 Opus 5 迁过来要改这几处。
- Sol:内置工具和函数调用走 Responses API;Chat Completions 只有在推理档设为 none 时才支持函数调用。调推理档位、开关工具不会再打断缓存。
适用场景对照
偏向 GPT-6 Sol 的场景:
- 批量流程与成本敏感型任务:Sol 的 API 单价为 Opus 5.5 的一半,在 AutomationBench 类业务流程任务中同档位成本约为其三分之一。
- 搭配使用 ChatGPT 生态:Plus 订阅同时涵盖 Astra、Sol 与 Luna,日常任务调用 Sol 节省用量,复杂任务切换至 Astra。Codex 中的模型切换与额度查看见 Codex 使用指南。
- 需要关闭思考链的轻量请求:支持将推理档位设为 none,降低简单调用的等待时间。
偏向 Claude Opus 5.5 的场景:
- 终端与长周期自动化任务:Terminal-Bench 4.0 测试得分为 66.4%(Astra 为 57.9%)。
- 知识密集与综合分析工作:GDPval-AA v2.1 评测得分为 1846 Elo(Astra 为 1542)。
- 追求默认档位的高合并率:FrontierCode 默认档位单任务成本接近的情况下,Opus 5.5 得分高 8.7 个百分点。
- 已有成熟的 Claude Code 工具链:团队已有完整的环境与提示词配置,迁移至新模型不需要改变现有工作流。
国内怎么开通 ChatGPT Plus / Pro
OpenAI 官方不收微信和支付宝,官方订阅对国内银行卡的支持也有限。PayForChat 是独立的第三方代充服务,流程是:登录网站、选择套餐、按页面说明提交当前 ChatGPT 的会话信息、微信支付,处理完成后回 ChatGPT 刷新订阅状态。全程不需要 ChatGPT 密码,失败订单按规则退款。套餐和价格以套餐页为准。
想用 GPT-6 Sol,Plus 就够。前提是账号已经轮到灰度,和账号是自己充还是代充没有关系。开通后在 ChatGPT Work 或 Codex 的模型选择器里找 Sol。它和 GPT-5.6 同名档位怎么区分,见 GPT-6 Sol / Luna 上线说明。超过 1 小时没到账就开工单。
PayForChat 暂不支持把仍在有效期内的 Plus 账号直接升级到 Pro。已有 Plus 的用户,等订阅到期恢复普通状态后再买 Pro,或者用干净的新账号开通 Pro(聊天记录和设置无法迁移)。
FAQ
Q: GPT-6 Sol 和 Claude Opus 5.5 是同一天发布的吗?
A: 是,都在 2026 年 9 月 22 日。所以两家公告里都没有对方这款新模型的数据:OpenAI 比的是 Claude Opus 5,Anthropic 比的是 GPT-6 Astra 和 GPT-5.6 Sol。
Q: 两家的跑分能直接放在一起比吗?
A: 只有 FrontierCode v1.1 和 AutomationBench 能。这两项两家都公布了,GPT 系列的分数在两家图表里完全一致。OSWorld 2.0 两边设置不同,同一个 Opus 5 在两边分别是 70.2% 和 74.0%,不能直接比。
Q: Opus 5.5 单价是 Sol 的两倍,用起来是不是也贵一倍?
A: 看任务类型。FrontierCode 编码任务在默认档,两者每任务成本都约 $0.80,Opus 5.5 分数更高。AutomationBench 业务流程任务里,Opus 5.5 每任务成本约是 Sol 的 2.6 到 3.2 倍,分数只高 1 到 2 个点。
Q: ChatGPT Plus 能用 GPT-6 Sol 吗?
A: 能。Plus、Pro、Business、Enterprise、Edu 都可以在 ChatGPT Work 和 Codex 里用 Sol,标准 Chat 里暂时选不到。Free 和 Go 只能在桌面版 App 里用 GPT-6 Luna。
Q: GPT-6 Sol 和 GPT-5.6 Sol 是同一个模型吗?
A: 不是。GPT-5.6 Sol 是上一代的旗舰,API 推广价 $4 / $20,知识截止 2026 年 2 月 16 日。GPT-6 Sol 是 GPT-6 家族的中间档,价格减半,知识截止 2026 年 4 月 20 日。API 里分别是 gpt-5.6-sol 和 gpt-6-sol。
Q: 我的 Plus 还没到期,可以直接升 Pro 吗?
A: PayForChat 暂不支持有效期内的 Plus 账号直接升 Pro。请等 Plus 到期后再买 Pro,或者使用新的普通账号开通 Pro。
参考来源
更新记录
- 2026-09-24:首发。数据取自 OpenAI、Anthropic 9 月 22 日的公告正文、公告图表数据点和两家 API 文档,未使用第三方榜单。OpenAI 用量估算表截至发稿未列 GPT-6 Sol,列入后补充。