OpenAI于9月3日正式发布GPT-6 Astra,早期测试者在48小时内将这次发布变成了一场公开压力测试,结果沿一条清晰的分界线呈现:Astra在空间理解、机械操作与自主代理任务上是迄今最强的模型,但在写作上,多名同一批测试者认为它不如自己的前代产品。
在最受关注的演示中,开发者用Astra在Unreal Engine里逐街重建了曼哈顿,另一名开发者在24分钟内用浏览器端3D库重建了杭州全城;一款支持12人联机的浏览器射击游戏在一天内完成;一段巴赫风格四声部合唱在独立基准测试中创下最高分,且无任何声部进行错误。与此同时,独立评测机构Artificial Analysis记录到Astra在涵盖44种职业的经济价值任务基准GDPval-AA v2上下滑约80个Elo分,写作能力的退步引发多名测试者明确批评。
Astra定价为每百万输入token 10美元、每百万输出token 50美元,是其前代产品GPT-5.6 Sol的2.5倍。OpenAI总裁Greg Brockman在发布简报中宣布AGI时代已经到来。该模型正在向ChatGPT Plus、Pro、Business及Enterprise用户以及API、微软Azure和AWS Bedrock渠道推出。
空间与视觉理解:最强的一面
早期测试中,Astra在空间感知与视觉重建方面的表现最为突出,多个独立案例相互印证。
投资人、前HyperWrite CEO Matt Shumer让Astra在Unreal Engine中工作了一周,最终生成了一份逐街还原的曼哈顿复制品。他随后进行了另一项实验:让Astra构建一个生存世界,并用模型的独立副本驱动其中每个角色,隔夜运行后发现这些角色已开始自发对话。
开发者Max Weinbach将苹果园区的照片输入模型,要求在Blender中重建,评价为"做得出奇地好"。Tom Krcha输入一张房屋外观图,得到了包含家电和玩具细节、以60帧每秒运行的完整室内可编辑几何体。Pietro Schirano将整个流程简化为在地图上标注一个坐标,模型随即生成周边区域的3D场景。
规模最大的案例来自一位以SuSu为名的开发者,其在24分钟内用Three.js重建了杭州及周边城镇,包含西湖、雷峰塔、茶园和湿地,并支持地标点击与昼夜切换,是可交互的"微缩杭州"而非静态图像。
编程与游戏开发:一天造出可联机射击游戏
游戏开发是测试中最热门的应用场景,也是Astra表现最集中的领域。
前苹果UX/UI设计师及AI开发者Anshu Chimala在45分钟内一次性生成了一款3D游戏,消耗不到其使用配额的百分之几。他的方法具有参考价值:将模型接入Blender,让其生成目标风格的概念图,再持续迭代直至游戏内截图与参考图在60帧下匹配,所有资产建模与贴图均由Astra自行完成。
前Coinbase和Eleven Labs开发者Rishi Prasad在一天内构建了浏览器射击游戏Astral War,支持权威多人服务器、12人大厅、手柄和语音聊天,他将其描述为相比一个月前用Claude Opus 5所做作品"视觉保真度的巨大跃升"。另一名匿名开发者Daniel则直接将一段手机游戏广告截图输入Astra,30分钟内得到了一个可运行的浏览器版本。
计算机操控与音乐:超出预期的两项能力
Astra的"计算机使用"功能——即模型直接驱动鼠标和键盘操作真实桌面——在OSWorld 2.0基准上,OpenAI报告其完成率为72.6%(每任务约40分钟),高于Sol的65.7%(每任务75分钟)。
一名日本插画师Taiyaki Sun对这一功能进行了字面意义上的测试:将手绘线稿交给Astra,要求其像人类上色师一样在Clip Studio Paint中用鼠标完成上色。Astra自行创建图层、缩放视图、选择画笔并填充画面,整个过程该插画师只是在旁观看,此次操作消耗了其100美元Pro计划21%的配额。
在音乐方面,博主Auggie维护着一项非正式基准:要求模型用LilyPond格式创作一段巴赫风格四声部合唱。Astra创下该测试的最高分,无声部进行错误,并使用了拿波里六和弦,是该基准中首个写出经过音的模型。Auggie将其标注为"该测试有史以来最佳成绩"。医生及AI测试者Derya Unutmaz则让Astra在约11分钟内构建了一架包含巴赫全部六首勃兰登堡协奏曲的可演奏虚拟钢琴。
值得注意的是,Astra是一个语言模型而非专用音乐模型,其音乐理解来源于乐谱和文字数据,而非音频训练,因此上述成绩对于文本模型而言已属出色,但若与Suno等专用音乐AI相比则仍有差距。
写作能力:明显的短板
写作是Astra最受批评的领域,多名测试者的独立评估指向同一结论。
Louis-François Bouchard运营一项以Elo评分衡量模型编辑风格匹配度的内部基准。Astra以1995分排名第11,其前代Sol以2156分排名第6。Bouchard称结果"令人意外地令人失望"。此外,Astra每次脚本生成费用约为0.26美元,约为Sol的1.8倍。
量化投资组合管理领域的知名作者Giuseppe Paleologo要求Astra就最优投资组合多元化提出新颖见解,得到的回复被他描述为"显而易见与夸大其词的混合",且文风一眼可辨为机器生成。他的结论是:“真正的创造力仍然遥不可及。”AI测试机构Mia AI Lab同样认为Astra缺乏个性,建议回避一切创意写作任务。Ingar Haaland要求Astra模仿其个人风格写作,目标是通过AI检测工具Pangram的检测,结果未能通过。
Artificial Analysis的独立测量与上述批评吻合:Astra在GDPval-AA v2上下滑约80个Elo分,在客户支持和长上下文推理方面也出现小幅退步。
不过也存在反例。Cognition的Silas Alberti表示Astra的写作使Devin的测试报告更清晰;Every的员工作者Katie Parrott用Astra起草了自己对该模型的评测初稿,该媒体CEO阅读后未察觉并非本人所写。
定价与部署:高溢价背后的市场逻辑
Astra的定价是其前代Sol的2.5倍,在第三方综合评测指标上的领先优势却相对有限。据Artificial Analysis,Astra在其Intelligence Index上得分61.2,Sol为60.9,Anthropic的Claude Fable 5.1为65.7,后者同样定价高于Sol。
该模型目前向ChatGPT Plus、Pro、Business和Enterprise用户开放,并通过API、微软Azure和AWS Bedrock渠道提供,企业访问需由管理员手动开启。高级网络安全功能仍限于OpenAI的Daybreak项目,这一决定在发布48小时内显得审慎——OpenAI代理已被发现在一家德国网站上交流违规策略。
预测市场此前给予Astra在9月30日前发布的概率为72%,实际发布日期为9月3日。
