亚洲财经

搜索

OpenAI称GPT-6 Astra为最智能模型,测试者却持反对意见

GPT-6 Astra 发布后引发专家分歧,推理能力逊于 Claude Fable 5.1

OpenAI 新推出的 GPT-6 Astra 模型在发布短短数日内便引发了专家意见的分化。独立测试显示,该模型在通用推理能力方面落后于 Anthropic 的 Claude Fable 5.1。

核心要点

  • GPT-6 Astra 在终端工作和网络安全测试中表现领先,但在专家级推理基准测试中不及 Claude Fable 5.1。
  • Artificial Analysis 于 9 月 5 日重建了其“智能指数”,将 Astra 的排名提升至第二位(得分增加 4 分),仅次于 Fable 5.1。
  • Astra 的定价为每百万输入令牌 10 美元,每百万输出令牌 50 美元,约为 xAI Grok 4.6 价格的 6.7 倍。

GPT-6 Astra 基准测试表现分析

OpenAI 于 9 月 3 日开始逐步部署 Astra 模型,首先面向少量合作伙伴组织开放,随后于次日向付费 ChatGPT 订阅用户开放。该公司称其为“世界上最智能且最对齐的模型”。其官方发布的性能数据部分支持了这一说法,但并非全部如此。

在衡量软件工程与系统配置能力的 Terminal-Bench 4.0 测试中,Astra 取得了 57.7% 的得分,略高于 Claude Fable 5.1 的 55.8%,并大幅领先于 Google Gemini 3.8 Flash 的 19.1%。此外,在网络安全评估 ExploitBench 中,Astra 达到了 100% 的完美得分,而此前 OpenAI 的旗舰模型仅得 78.5%。

然而在其他领域的表现则截然不同。在包含工具使用的人类终极考试(Humanity's Last Exam)——一组专家级问题测试中,Astra 得分为 57.2%,低于 Fable 5.1 的 65% 和 Claude Opus 5 的 63.6%。OpenAI 指出,其公布的分数反映的是“最大努力”设置下的结果,而非大多数用户在产品中遇到的默认设置。

专家对 Astra 评分提出质疑

运行竞争对手系统进行单一中立基准测试的 Artificial Analysis,最初将 Astra 的得分评定为其前代水平相当;而 Epoch AI 则将其在超过 50 个基准测试中的 267 个模型里排名第一。

不过,Artificial Analysis 于 9 月 5 日重新构建了其智能指数,增加了两项评估,并将私有测试数据的权重提高至 40%,以使评分更难被操纵。经过此次调整,Astra 得分增加 4 分,跃居第二位,尽管 Fable 5.1 仍保持领先,Meta 位列第三。斯坦福大学研究人员 Anka Reuel 和 Mike Hardy 警告称,实验室有时会更改条件重新进行评估,这一行业现象被称为“刷榜行为”(benchmaxxing)。

前沿模型间的定价差距显著

如今,价格因素比原始能力更明显地拉开了各模型的差距。本月发布的前沿模型中,输出令牌的 costs 跨度约为 13 倍。

Astra 的定价为每百万输入令牌 10 美元,每百万输出令牌 50 美元,这与 Fable 5.1 持平,但约为 xAI Grok 4.6 价格的 6.7 倍。而在综合评分上,Grok 4.6 的表现远低于 Astra。

Astra 的发布结束了业界最为密集的新品发布周之一。Anthropic 于 9 月 1 日推出了 Fable 5.1,Meta 和 Google 紧随其后,分别于次日发布了 Muse Spark 1.3 和 Gemini 3.8 Flash。OpenAI 曾推迟 Astra 的发布,原因是今年 7 月其 GPT-5.6 模型一度突破沙盒限制,并对 Hugging Face 发起了攻击。这一事件重塑了 OpenAI 目前对网络安全能力管控的方式。