GPT-6 Astra:发布、基准测试、价格和OpenAI的AGI声明

Avatar
Lisa Ernst · 05.09.2026 · 人工智能 · 12分钟

GPT-6 Astra已正式发布。OpenAI于2026年9月3日发布了新的旗舰模型,宣布在计算机控制、编码、数学、网络安全和长上下文方面取得了显著的飞跃。与此同时,OpenAI总裁Greg Brockman声称Astra标志着AGI时代的开端,这引起的关注程度至少与实际的基准测试分数相当。

截至2026年9月5日,访问仍在逐步推出。因此,本文将已确认的产品数据与OpenAI的自我评估区分开来:GPT-6 Astra的实际价格、ChatGPT Astra将向谁开放、哪些基准测试特别强大、竞争模型在哪些方面仍然领先,以及为什么ARC-AGI-3上的99.9%分数还不是AGI的科学证据。

简而言之

什么是GPT-6 Astra?

GPT-6 Astra是OpenAI面向特别复杂的端到端任务的最新旗舰模型。OpenAI将其定位为不仅仅是一个更好的聊天机器人,而是一个能够直接与软件交互、操作浏览器和桌面界面、编写代码、进行复杂研究以及生成专业文档的模型。在其官方公告中,OpenAI将Astra描述为其迄今为止“最智能、最专注”的模型。这种措辞是制造商的评估,不应与独立的排名混淆。

技术上,最引人注目的是其巨大的上下文窗口。API文档提到了1,050,000个Token的上下文以及最多<strong>128,000个输出Token</strong>。记录的知识截止日期为2026年4月30日。对于推理,开发人员可以选择<code>low</code>、<code>medium</code>、<code>high</code>、<code>xhigh</code>和<code>max</code>的级别。想要了解前代发展的,可以在Zerlo找到关于GPT-5.6 Sol及其ChatGPT发布.

GPT-6 Astra发布:谁将获得ChatGPT Astra?

此次发布并非在9月3日为所有账户同时全球开启的开关。OpenAI首先面向一小部分组织推出,并宣布将在接下来的几天内为ChatGPT Plus、Pro、Business和Enterprise推出GPT-6 Astra。Pro、Business和Enterprise客户还将获得GPT-6 Astra Pro的访问权限。对于Enterprise客户,Astra在启动时默认禁用,需要由管理员为其工作空间启用。

重要提示:OpenAI在Astra的公告中没有提及对Free或Go账户的普遍开放。因此,即使您拥有符合条件的套餐,如果在9月5日2026年尚未看到该模型,也可能只是仍在分阶段推出的过程中。根据OpenAI的说法,ChatGPT中Astra的使用包含在现有的套餐配额内;额外的使用可以通过积分进行。因此,没有单独宣布的月度“Astra套餐”。

Microsoft Azure徽标

来源: simpleicons.org

GPT-6 Astra不仅直接通过OpenAI提供。OpenAI明确指出Microsoft Azure是为开发人员和企业提供的另一个分发渠道。

Amazon Web Services徽标

来源: simpleicons.org

AWS Bedrock也包含在宣布的Astra发布中。对于现有的云架构,这可能比直接切换到OpenAI API更重要。

GPT-6 Astra基准测试:进步有多大?

最强的数据位于以往智能体模型迅速遇到瓶颈的领域:抽象问题解决、计算机控制、软件开发和主动安全任务。OpenAI的发布包括外部基准测试和内部测试。对于内部评估,自然无法进行独立的复现。

基准测试 GPT-6 Astra GPT-5.6 Sol 定性
ARC-AGI-3 99,9 % 7,8 % 在新的交互式抽象任务上取得巨大飞跃
FrontierMath Tier 4 (v2) 97,6 % 83,0 % 在复杂数学上表现出极高的性能
Terminal-Bench 4.0 57,9 % 37,3 % 在终端中的智能体编码方面取得显著进步
OSWorld 2.0 72,6 % 65,7 % 改进的计算机控制;OpenAI还报告了显著缩短的任务时间
AutomationBench 41,4 % 18,1 % 专业自动化任务的分数提高了一倍以上
ExploitBench 100,0 % 78,5 % 在受控测试中显示出非常强大的漏洞开发能力

这些数字令人印象深刻,但需要背景。OpenAI自己指出,GPT评估是在研究环境或通过API进行的。生产环境中的ChatGPT,由于不同的系统提示、工具和安全机制,可能会产生不同的结果。此外,比较表中显示的是不同推理开销下的最佳分数。

Astra并非在所有测试中都获胜。一个很好的反例是带有工具的Humanity's Last Exam:Astra得分为57.2%,而Claude Fable 5.1在同一OpenAI表格中得分为65.0%。Astra的Artificial Analysis Intelligence Index为61.2,也低于表中列出的几个Claude模型。这反驳了Astra在每个维度上自动是最佳模型的简单说法。

为什么ARC-AGI-3备受关注

从GPT-5.6 Sol的7.8%飞跃到GPT-6 Astra的99.9%,是此次发布中最引人注目的单一数据。ARC-AGI-3旨在测试一个系统是否能在新的、交互式环境中发现规则并有效行动,而不仅仅是检索已知模式。ARC Prize Foundation在OpenAI的发布文章中表示,Astra在96%的关卡上超越了人类的行动效率基线。这是新问题解决能力的一个强有力信号——但还不是衡量所有人类能力的通用标准。

GPT-6 Astra价格:API收费多少?

对于开发人员来说,定价结构比ChatGPT套餐更清晰:OpenAI在标准API中按Token计费。这些数值是每100万个文本Token的价格。

计费 每100万Tokens价格
输入 10,00 US-Dollar
缓存输入 1,00 US-Dollar
缓存写入 12,50 US-Dollar
输出 50,00 US-Dollar

对于非常大的提示,成本会更高:一旦请求包含超过272,000个输入Token,OpenAI将对整个请求收取双倍的输入和缓存费率,以及1.5倍的输出费率。根据模型文档,Batch和Flex的费用为标准费率的50%。而Fast模式的费用是相应费率的两倍,但速度最高可提升一倍。

因此,虽然最大的上下文窗口在技术上很有吸引力,但并非在经济上总是如此。那些经常在智能体运行中输入数十万Token的用户,应该认真考虑提示缓存、上下文选择和任务分解。Zerlo关于ChatGPT 5.4及其API定价结构的旧概述显示了成本在模型代际之间的巨大变化。

OpenAI是否通过GPT-6 Astra实现了AGI?

声明已确认,但尚未证明。Axios报道称,在发布新闻发布会上,OpenAI总裁Greg Brockman表示,他个人认为OpenAI通过Astra实现了AGI,或者说该模型可以被回顾性地视为通用人工智能的到来。他同时将最终的定性留给用户。OpenAI的官方产品文章非常积极地将Astra定位为新一代智能,但没有提供任何独立的认证,证明已达到普遍接受的AGI阈值。

核心问题在于定义。对于AGI,不存在一个普遍接受的测试,达到该测试后,模型就可以被客观地视为“AGI”。一个模型可以几乎饱和一个单独的抽象基准测试,但仍在其他领域落后于竞争模型,犯错误,需要安全限制,或者在实际的长期任务中失败。OpenAI自己的基准测试表就显示了这一点:Astra在ARC-AGI-3上表现异常出色,但在带有工具的Humanity's Last Exam上并非顶尖。

因此,最符合事实的表述是:GPT-6 Astra是当前AGI辩论中一个非凡的有力竞争者,但OpenAI的AGI声明仍然是公司和管理层的评估。研究界和公众是否也认为达到了这个门槛,取决于使用的AGI定义以及实际应用中的独立复制。

计算机控制和智能体:Astra在这里变得实用

与传统的聊天模型相比,最重要的变化不仅是更多的知识或更高的编码分数,而是执行任务的能力。OpenAI举例说明了表单处理、CRM更新、日历组织、研究、软件安装、故障排除、数据分析和前端QA。在OSWorld 2.0上,Astra得分为72.6%,而GPT-5.6 Sol为65.7%。在OpenAI的延迟模拟中,Astra每个任务大约需要40分钟而不是75分钟——时间减少了约47%。

对于企业来说,这种推理、计算机使用和长上下文的结合可能比知识基准测试上多一个百分点更重要。一个能够正确理解任务、操作多个应用程序并在长流程中保持上下文的智能体,有可能改变整个工作流程。但同时,权限、确认对话、日志记录和明确界限的重要性也在增加。

另一面:Astra达到了OpenAI的网络安全“关键”阈值

OpenAI将GPT-6 Astra列为其第一个在准备框架中达到“ExploitGym和人工智能驱动的漏洞利用开发.

OpenAI对此的回应是加强保护机制,并对高级的攻击性网络任务进行限制。与此同时,有一个令人不快的第二个观察:在专门设计的对抗性测试中,Astra的书面推理能力

这只是表面上看起来与OpenAI关于Astra“对齐”程度更高的说法相矛盾。一个模型在正常行为中可能更频繁地遵守预设的界限,但仍然拥有技术上更危险的能力。正是因为这个原因,模型行为、基础能力和外部保护系统需要分开考虑。

GPT-6 Astra对用户和开发者的意义是什么?

对于普通ChatGPT用户来说,最重要的短期问题是推出。使用Plus、Pro、Business或Enterprise的用户不应认为9月5日尚未获得Astra访问权限是错误。OpenAI明确表示将分几天逐步推出。

对于开发者来说,决定更多地是经济性的。Astra尤其适用于单次成功运行具有高价值的场景:复杂的代码代理、大型代码库、计算机使用自动化、高级研究或长期的专业工作流程。对于简单的分类、简短的文本生成或成本敏感的大规模任务,较小的模型可能仍然更合适。每百万token 50美元的高输出价格以及非常长的上下文的附加费用,使得清晰的模型选择变得更加重要,而非不重要。

对于企业来说,还有一个第三个因素:治理。更强大的代理不应自动获得更多权限。特别是对于文件系统、浏览器、电子邮件、内部应用程序和云资源,最小权限、不可逆操作的确认以及可追溯的审计跟踪应保持为标准。

常见问题解答

GPT-6 Astra何时发布?

OpenAI于2026年9月3日发布了GPT-6 Astra。最初在有限数量的组织中推出,随后将逐步扩展到ChatGPT Plus、Pro、Business和Enterprise,以及API、Microsoft Azure和AWS Bedrock。

ChatGPT Plus是否已提供GPT-6 Astra?

OpenAI已明确宣布Plus将进行推出。由于分几天推出,在2026年9月5日,符合条件的Plus账户可能仍然没有Astra访问权限。这本身并不一定意味着技术错误。

GPT-6 Astra在API中的价格是多少?

标准价格为每100万输入token 10美元,每100万输出token 50美元。缓存输入价格为每100万token 1美元,缓存写入价格为12.50美元。超过272,000输入token的请求将受到更高的倍数影响。

GPT-6 Astra的上下文窗口有多大?

OpenAI API文档提到上下文窗口为1,050,000个token,最大输出token为128,000个。然而,非常长的请求不仅在技术上要求更高,而且当输入token超过272,000个时,价格也更高。

GPT-6 Astra是否真的实现了AGI?

这一点尚未得到客观证明。Greg Brockman表示,他个人认为OpenAI已经实现了AGI,或者说Astra可以被视为AGI时代的开端。然而,目前还没有一个普遍接受的科学基准来确定通用的AGI阈值。因此,这一声明应被视为OpenAI的评估,而不是一个已完成的科学事实。

GPT-6 Astra是否比GPT-5.6 Sol更安全?

OpenAI报告称在多项对齐和边界测试中取得了更好的结果,但同时Astra具有更强的网络能力,并且在对抗性测试中更难通过其书面推理进行监控。“更安全”取决于您是考虑行为、底层能力还是可监控性。

结论

GPT-6 Astra是一个真实且技术上非凡的发布,并非仅仅是谣言。最强有力的证实点是105万token的上下文窗口、在计算机使用和编码方面取得的显著进步,以及在ARC-AGI-3、FrontierMath和网络安全基准上的极高分数。同时,仍需要一个细致的看法:Astra并非在所有比较中都处于领先地位,推出仍在进行中,而新的网络能力带来了额外的安全风险。

因此,OpenAI的AGI主张是此次发布中最需要解读的部分。Brockman的说法值得注意,但即使在ARC-AGI-3上获得近乎完美的分数,也无法将一个有争议的定义变成一个已完成的科学事实。对于用户来说,Astra主要是一个非常强大的新ChatGPT和代理模型;至于它是否会被追认为AGI时代的开端,则有待独立的测试和长期的实际使用来证明。

分享我们的文章!
来源