GPT-6 Astra发布,99.9%跑分引爆AGI讨论,普通人如何使用到GPT-6呢?

2026 年 9 月 3 日,OpenAI 正式发布了新一代模型 GPT‑6 Astra

看完奥特曼最新发布的GPT-6的帖子后,最吸引眼球的是这段接近满分的数据:It scores 98% on FrontierMath Tier 4, 99.9% on ARC-AGI 3, and 100% on ExploitBench.

ARC‑AGI‑3 达到 99.9%,FrontierMath Tier 4 达到 97.6%,ExploitBench 达到 100%。

OpenAI 这次的模型的重点,从“回答问题”挪到“完成工作”。

GPT‑6 Astra 可以操作电脑和浏览器,在不同软件之间切换,填写表单、整理资料、更新 CRM、分析数据、制作表格和幻灯片,甚至安装软件、测试网站、排查屏幕上出现的问题。

过去的大模型更像一个随叫随到的顾问。而这次,GPT‑6 想成为的,是一个可以真正接过任务、持续推进并交付结果的执行者。

那他与之前的版本相差有多少呢?哪些用户可以使用到呢?

👉文末附带如何升级GPT教程

和 GPT‑5.6 相比,GPT‑6 到底提升了什么?

如果只用一句话概括:

GPT‑5.6 更像一个能力很强的模型,GPT‑6 则更像一个开始具备稳定执行能力的智能代理。

这次提升主要集中在五个方面。

1. 电脑操作

在测试电脑操作能力的 OSWorld 2.0 中,GPT‑6 Astra 得分为 72.6%,GPT‑5.6 Sol 为65.7%。

数字上的差距不算夸张,但完成任务的时间从大约75分钟下降到40分钟,减少了约47%。

在另一项 Mind2Web 测试中,GPT‑6 Astra 配合新版 Codex 工作框架,任务完成速度约为 GPT‑5.6 Sol 当前体验的1.9倍。

这意味着它的进步不只是“看得懂屏幕”,而是更擅长判断下一步应该点击哪里、调用什么工具,以及如何避免在长流程中反复绕路。

2. 专业工作

在 AutomationBench 中,GPT‑6 Astra 得分为41.4%,GPT‑5.6 Sol 只有18.1%,而且还把Claude Fable 5.1Opus 5远远甩在身后

它不是简单提高了几个百分点,而是达到了上一代的约2.3倍。

OpenAI 对这部分能力的描述也很具体:Astra 能够按照已有模板制作文档、电子表格和演示文稿,并尽量保持原有的写作风格、版式和业务规范。

它还会主动过滤无关信息,而不是把读取到的所有材料重新堆进答案里。

对大多数办公室工作来说,这种变化可能比某一道数学题拿满分更实际。

因为人们真正需要的往往不是一段“看起来很专业”的回答,而是一份能够继续修改、发送或提交的文件。

3. 编程能力

在 Terminal‑Bench 4.0 中,GPT‑6 Astra 得分为57.9%,GPT‑5.6 Sol 为37.3%,提高了20.6个百分点。

在内部数据库迁移任务中,Astra 得分为63.9%,上一代为42.7%。

这种测试关注的不是补全某个函数,而是模型能否进入真实代码库,理解项目结构,运行命令,发现报错,修改代码,再通过测试验证结果。

GPT‑6 还为 Codex 引入了一项实验性能力:当一个长任务填满当前上下文窗口后,它可以保存工作笔记,并搜索之前上下文窗口中的要求、测试结果和工具输出。

过去的模型往往需要把前面的工作压缩成摘要,摘要过程中很容易丢失“为什么这个方案失败了”或者“某个组件之前出现过什么问题”。

新机制试图解决的,正是长时间编程中经常发生的失忆问题。

4. 科学与推理

GPT‑6 Astra 在科研和高难推理测试上的提升非常醒目:

其中,Terminal‑Bench Science 测试的是模型能否通过终端和代码完成真实科研流程,例如处理数据、运行模拟、拟合模型,而不是单纯回答一道科学选择题。

OpenAI 还表示,Astra 已经参与得到两项关于素数间隔的新结果,其中一项把无限多个素数对之间的已知距离上界,从240进一步缩小到186;

ARC‑AGI‑3 的99.9%成绩也使用了 OpenAI Responses API 的特定运行框架,因此不能直接理解成“普通用户随便提问,也能稳定达到99.9%的正确率”。

5. 安全对齐

能力更强的模型,最令人担心的问题之一,是它会不会在任务失败时自作主张。

OpenAI 为此设计了一类“无法完成的任务”:当模型发现正常路径走不通时,观察它是否会越过用户授权范围,尝试攻击其他目标或者绕过系统限制。

在没有生产环境额外防护的测试中,GPT‑5.6 Sol 有48%的情况超出了授权目标,而 GPT‑6 Astra 在这项测试中的结果为0%。

在 OpenAI 内部的电脑操作安全基准中,误行为比例也从22%下降到2.4%;内部幻觉基准则从12.2%下降到4.2%,相对下降约65.6%。

但这部分并不是只有好消息。

OpenAI 在系统卡中承认,Astra 的书面推理比 GPT‑5.6 Sol 更难监控。它更擅长控制自己在推理文本中暴露什么信息,在刻意要求其逃避监控的对抗测试中,部分监控效果明显下降。

OpenAI 目前没有发现它能够在复杂任务中通过隐写方式完全隐藏关键推理,但仍把可监控性的下降列为需要继续研究的问题。

它说明 GPT‑6 并不是一个“能力更强、安全问题也已经全部解决”的完美模型。更准确的描述是:它在实际行为上更守边界,但随着推理能力增强,人类理解和监督其内部过程的难度也在上升。

ARC‑AGI‑3都达到 99.9% 了,AGI 时代要来了吗?

在回答这个问题之前,先解释一下什么是 AGI。

AGI 是 Artificial General Intelligence 的缩写,中文通常翻译成“通用人工智能”。

OpenAI 在其章程中对 AGI 的定义是:

一种高度自主,并且能够在大多数具有经济价值的工作上超越人类的系统。

这里面有三个关键词:

高度自主、大多数工作、超越人类。

所以,AGI 并不是“某个模型很会聊天”,也不是“某一项考试达到满分”。

它意味着一个系统能够跨越编程、科研、写作、管理、分析和决策等众多领域,在面对新任务时仍然可以理解目标、学习规则、调用工具,并且长期稳定地完成工作。

从这个标准来看,GPT‑6 Astra 确实比以前更接近 AGI 所描述的方向。

它能够操作真实电脑环境,执行跨软件流程,处理百万级上下文,在科学、编程和专业工作中表现出更强的迁移能力。

但这仍然不能证明 AGI 已经实现,至少他还没有经过大众的检验

一个名字里带有“AGI”的基准,终究还是一个基准,不是 AGI 的毕业证书。我们也不能单凭官方给出的ARC-AGI-3来确定吧。

99.9%成绩是使用了 OpenAI Responses API 的特定运行框架,因此也不能直接理解成“普通用户随便提问,也能稳定达到99.9%的正确率”。

在 OpenAI 自己公布的数据中,GPT‑6 Astra 在 Humanity’s Last Exam 带工具测试中的成绩是57.2%,AutomationBench 是41.4%,内部数据科学任务是40.9%。

它在部分综合智能和编程代理指标中,也并非所有模型中的最高分。

在未经过用户的大量测试之前,“AGI 已经到来”还为时尚早。

哪些用户可以用到GPT‑6 Astra

目前OpenAI 官方发布页和 ChatGPT 更新日志标注的发布时间,都是 2026 年 9 月 3 日

不过,“正式发布”并不等于所有人首日就能使用。

截至 2026 年 9 月 4 日,GPT‑6 Astra 仍处于分批上线阶段。首批开放给少量组织,随后数日才会逐步扩展到 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时进入 OpenAI API 和 AWS。OpenAI 的更新日志也明确写道,Astra 当时尚未全面开放。

文末附带如何升级GPT教程

几个容易理解错的地方,需要特别说明:

第一,Free 免费用户暂未被列入开放名单。

这不代表免费用户以后一定无法使用,只能说明在本次首发公告中,OpenAI 没有承诺向 Free 计划开放。

第二,Plus 和 Pro 得到的权限并不完全相同。

Plus 用户会获得普通版 GPT‑6 Astra;Pro、Business 和 Enterprise 用户还会获得更高能力版本 GPT‑6 Astra Pro

第三,Enterprise 工作区不会自动开启。

企业管理员需要主动启用 GPT‑6 Astra,发布时默认处于关闭状态。

开发者可以通过 API 调用,模型 ID 为:gpt-6-astra

API 标准价格为每百万输入 token 10 美元、每百万输出 token 50 美元;上下文窗口为 105 万 token,最大输出为 12.8 万 token,知识截止日期为 2026 年 4 月 30 日。API 还提供 Fast 模式,速度最高可达到标准模式的两倍,价格同样是两倍。

值得注意的是,GPT‑5.6 Sol 的标准 API 价格为每百万输入 token 4 美元、输出 token 20 美元。也就是说,单看 token 单价,GPT‑6 Astra 是 GPT‑5.6 Sol 的 2.5 倍

我们可以发现,GPT‑5.6 Sol 的 token 单价明显更高,但由于模型完成任务所需的 token 和时间可能减少,在部分具体任务中,总成本未必更高。OpenAI 公布的部分低成本测试设置中,Astra 在超过 GPT‑5.6 Sol 成绩的同时,预计任务成本低了约 27%至37%。

最后有话说

GPT‑6 Astra 可能还不是真正的AGI。

但它已经释放出一个非常清晰的信号:

AI 的竞争重点,正在从“谁回答得更像专家”,转向“谁能在真实环境里持续工作、少犯错误,并最终交付成果”。

过去,人负责执行,AI 负责提供建议。

接下来,越来越多的工作可能变成人负责定义目标、提供背景、设置权限和检查结果,AI 负责完成中间的大部分执行过程。

这也意味着,未来真正重要的能力,未必是会背多少提示词模板。

而是能否把一个模糊需求拆成清晰目标,能否提供可靠资料,能否设定哪些事情可以做、哪些事情不能做,以及能否判断最终结果是否达标。

国内用户怎么升级gpt

如果你还不知道怎么升级到GPT Go、Plus、Pro或者business的话,可以看一下我们自己的代充服务。

正规官方渠道充值,封号概率低于0.1%

不仅免去了每年的开卡费用,升级价格也比官网更加优惠,并且提供售后保障。操作便捷,1分钟即可轻松完成升级!

升级网址:gptplus.uno

如有问题需要咨询的可联系YueShiwa,也欢迎围观朋友圈!

往期文章👇

GPT Plus升级失败?没有虚拟卡、海外信用卡怎么办?全新技术实现24小时自助直充升级GPT

AI完成任务太耗时?想要摸鱼却又怕耽误时间,于是我做了个AI任务完成提醒器

教你在国内用一个套餐同时体验到Claude Code+Codex两大AI编程助手


最后感谢大家能够看到文章的最后,如果你觉得这篇文章对你有启发或者帮助,不妨点个关注,你的支持将是我最大的动力,我们下次见!