GPT-6 Astra 发布后,搜索热度最高的问题不是“API 每百万 Token 多少钱”,而是:它是不是 AGI?
先给结论:目前不能把 GPT-6 Astra 直接等同于已经实现的 AGI。更准确的说法是,OpenAI 把它描述为“AGI 时代的第一个模型”,并展示了跨领域推理、计算机操作和长任务执行能力。这是路线和能力的宣示,不是一个全球统一、可审计的 AGI 认证。
如果只看结论
- OpenAI 的表述变了:公司高管称 Astra 可以被视为“AGI 时代”的起点,但官方发布页仍然围绕模型能力和安全部署展开。
- 能力已经进入 AGI 讨论区间:Astra 在 ARC-AGI-3、数学科学、计算机使用和自治任务上出现跨任务提升,但分数依赖工具、评测 harness 和任务设置。
- 普通用户不必等待“AGI 开关”:真正影响体验的是它能否稳定完成一项完整工作,能否被约束、复核和纠错,而不是产品页面上是否出现 AGI 标签。
想直接体验 ChatGPT 或 Codex 的完整能力,可以查看 PayForChat 套餐。套餐价格以页面实时信息为准。
“AGI 时代”到底是谁说的
2026 年 9 月 GPT-6 Astra 发布报道中,OpenAI 总裁 Greg Brockman 将 Astra 描述为可以被视为“AGI 时代第一个模型”的产品。媒体因此大量使用“Welcome to the AGI era”作为标题。
这里有一个容易被忽略的差别:
- “AGI 时代开始”是对技术阶段的判断;
- “Astra 已经是 AGI”是对一个系统是否达到统一标准的判断。
前者可以是公司对产品方向的表述,后者需要回答能力范围、稳定性、自主性、经济价值、安全性和可重复验证等问题。两者不能直接画等号。
Astra 为什么会被拿来和 AGI 讨论
1. 不再只展示聊天能力
OpenAI 的发布材料把 Astra 放在浏览器、终端、代码和长流程任务里介绍。模型不只是回答“怎么做”,还可以在授权工具里观察环境、制定步骤、执行操作,再根据结果返工。
这让评估对象从“单轮回答质量”变成“能否完成一项开放式工作”。这是 AGI 讨论里最重要的变化之一。
2. ARC-AGI-3 关注陌生环境中的学习
公开资料显示,Astra 在 ARC-AGI-3 的工具辅助设置中最高达到 99.9%;ARC Prize 的独立说明则强调,Astra 在 96% 的关卡上用少于测试人类中位数的动作数完成任务。
这个结果很亮眼,但不能简化成“已经达到人类全部智能”。ARC-AGI-3 测的是抽象规则发现和行动效率,不能覆盖常识、长期记忆、现实责任、社会协作等全部维度。
还要看测试条件:是否允许 provider adapter、工具如何提供、失败能重试几次,都会影响最终分数。读分数时必须连同评测设置一起读。
3. 跨领域分数同时上升
目前公开资料里常被引用的数字包括:
| 能力方向 | 公开结果 | 应该怎样理解 |
|---|
| ARC-AGI-3 | 最高 99.9% | 工具辅助下的抽象规则与行动任务 |
| GPQA Diamond | 96% | 研究生级科学问题 |
| FrontierMath Tier 4 | 97.6% | 高难度数学推理 |
| Terminal-Bench 4.0 | 57.9% | 复杂软件与数据终端任务 |
| OSWorld 2.0 子集 | 72.6% | 计算机操作任务 |
这些数字共同说明 Astra 的能力面变宽了。它们不能证明 Astra 在所有现实任务上都可靠,也不能证明它拥有人的目标、经验和责任感。
AGI 至少要看五个维度
通用性
能否从数学、写作、代码、研究和日常软件操作之间迁移方法,而不是每换一个任务就重新训练。Astra 的跨基准提升支持“通用性变强”,但真实世界的任务分布远比基准复杂。
自主性
能否把一个目标拆成多步,自己选择工具,遇到失败后调整计划。Astra 的长任务和计算机操作能力让自主性更接近实用,但默认仍应设置权限和停止条件。
稳定性
偶尔完成一次不算。重要任务需要在不同输入、不同环境和多次重试下保持可接受结果。单次最高分不等于生产稳定性。
经济价值
AGI 如果不能持续替人完成真实工作,只能算实验室能力。判断 Astra 是否有实际价值,要看它是否能减少人工步骤、缩短交付时间,并且把复核成本控制在可接受范围。
安全与可控性
Astra 是 OpenAI 首个达到 Critical 网络安全能力等级的模型。这个说法意味着它可以在特定条件下独立发现漏洞并构造利用链,也意味着部署需要更严格的访问控制、监控和分阶段开放。能力越强,不能越随意放权。
“Critical” 和 AGI 不是一回事
Critical 是 OpenAI 的安全能力分级,描述的是模型在网络安全任务上的能力和潜在风险。AGI 则是关于系统是否具备广泛、稳定、可迁移的通用智能。
一个模型可以在网络安全上达到 Critical,却仍然在事实可靠性、长期目标保持或现实责任上存在明显缺口。反过来,一个通用能力很强的系统也不应因为某个单项安全能力而自动获得 AGI 结论。
普通用户如何判断“像不像 AGI”
不要先看宣传词,先用一项完整任务测试:
- 给它一个真实目标,而不是单个问题;
- 限定允许访问的文件、网站和工具;
- 要求它先列计划,再执行;
- 让它自己运行检查或测试;
- 人工核对关键事实、权限和最终结果;
- 连续重复 10 到 20 次,记录成功率、返工次数和耗时。
例如,“整理一份竞品报告”不应只看首稿是否漂亮,还要看它能否找到来源、标出不确定信息、修正错误链接,并在第二次运行时保持结构稳定。
这套方法比问“它是不是 AGI”更接近真实使用价值。
现阶段最准确的说法
关于 GPT-6 Astra,建议使用以下三种表达:
- 可以说:它是 OpenAI 目前最接近通用自治工作流的公开模型之一;
- 可以说:OpenAI 把它定位为“AGI 时代”的起点;
- 不要直接说:它已经被全行业确认是 AGI,或者已经具备人的全部智能。
这不是保守措辞,而是把产品宣传、评测结果和可验证事实分开。
哪些情况继续用旧模型也合理
低风险问答、固定格式写作、简单代码补全,不一定需要 Astra。团队更在意成本、延迟、数据不出本地,或者任务有明确规则时,成熟的小模型可能更合适。
对高权限任务也不要因为“AGI”标签就跳过审批。删除数据、改生产配置、发送对外邮件和处理敏感资料,都应保留人工确认和可回滚记录。
PayForChat 是独立第三方订阅服务,不代表 OpenAI、GitHub 或任何模型厂商。
FAQ
Q:GPT-6 Astra 已经是 AGI 了吗?
A:目前没有一个被全球统一采用的认证结论。更准确的说法是,OpenAI 将 Astra 称为“AGI 时代”的第一个模型,并展示了接近通用自治系统的能力。
Q:ARC-AGI-3 99.9% 能证明 AGI 吗?
A:不能。它只覆盖抽象规则与行动任务,而且结果依赖工具和评测设置。
Q:Critical 网络安全等级是不是 AGI 等级?
A:不是。Critical 是安全能力分级,AGI 是通用智能判断,两个概念不同。
Q:普通人现在能用到 Astra 吗?
A:具体入口、套餐和地区会影响可用性。ChatGPT、Codex、API 和第三方产品是不同的服务路径,应分别核对当前页面。
Q:判断 AI 是否接近 AGI,最应该看什么?
A:看它能否在陌生环境中稳定完成多步骤任务,并在失败后自我纠错,同时接受权限、审计和人工复核。
参考来源
更新记录
2026-09-05:根据 OpenAI、ARC Prize、Axios、CNBC 等公开资料,补充“AGI 时代”表述、ARC-AGI-3 结果和 Critical 安全能力说明。