对现实的渴求:拆解 GPT-6 Astra

GPT-6 Astra 发布的四个数字:99.9 对 62.7、100 对 39、61.2 对 60.9,以及 2.5 倍的价格。进步已经搬进了 harness。

对现实的渴求:拆解 GPT-6 Astra
提升在脚手架里,不在模型里

所有现代语言模型赖以建立的 Transformer 架构,是 2017 年在谷歌被提出的。OpenAI 在几乎无人相信它的时候押注于扩展这套架构,此后每年推出一款旗舰模型。问题在于,每一次新发布中真正的进步究竟发生在哪里。

2026 年 9 月 3 日,OpenAI 发布 GPT-6 Astra,并宣告 AGI 时代到来。公司总裁格雷格·布罗克曼用一句话概括了这次发布:ARC-AGI-3 测试已被完全攻克。

几个小时后,制作这项测试的组织公布了自己的测量结果。它与 OpenAI 的数字相差近四十个百分点。

下面这四个数字,比围绕这次发布的全部营销都更能说明问题。

第一个数字:99.9 对 62.7

ARC-AGI-3 检验的是在陌生交互环境中弄清状况的能力。模型被放进训练数据里没有出现过的世界,必须一边推进一边摸清规则。这正是通常被称作人与统计模型之间那条界线的能力。OpenAI 报告的是 99.9%。测试的作者组织 ARC Prize 测得 62.71%。两个数字都是真的,差别在于模型是怎么跑的。

这里必须说说 harness:它不是神经网络本身,而是模型外面的那层脚手架,是启动模型、保存它的笔记、把任务分块喂进去并收集回答的外部程序。OpenAI 用的是自家的 harness:它在步骤之间保留模型的内部推理,并对长对话做了聪明的压缩。ARC Prize 用的是标准版本,对所有模型一视同仁。

ARC Prize 的结论是:差距源自记忆的处理方式,而两次用的是同一个神经网络。三十七个百分点的提升来自模型周围的代码,也就是 harness。

第二个数字:100 对 39

ExploitBench 检验模型能否在程序中找出漏洞。Astra 拿到 100%。

同一套测试,去掉历史漏洞后重新组装,也就是排除那些网上早有描述、已经进入训练数据的洞,结果是 39%。

这正是争论了多年的问题,被一个数字摊开来。凡是此前已被解决过的任务,结果近乎完美。凡是真正全新的任务,成绩掉到原来的四成。

当然,在寻找未知漏洞上拿到 39% 依然很高。OpenAI 给这款模型标定关键级网络安全能力、并对公众关闭部分功能,并非没有道理。但 100% 与 39% 之间的差距,首先说明的是系统对已知事物的记忆很好。至于发现根本性新事物的能力,这个差距能说明的要少得多。

第三个数字:61.2 对 60.9

独立的模型对比平台 Artificial Analysis 在综合智能指数上给了 Astra 61.2 分。上一代 GPT-5.6 Sol 是 60.9 分。一代之间只差 0.3 分。在智能体式编码上,也就是模型长时间自己干活的任务里,写代码、运行、看到报错、修好,差距同样存在:67.0 对 65.1。进步是有的,而且依然出现在模型与外部工具循环协作的地方。

第四个数字:2.5 倍

根据官方定价,Astra 每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元。这比上一代旗舰贵了两倍半。

总结起来:综合智能指数几乎没有提升,价格却涨了两倍半。

把画面拼起来

提升出现在脚手架被改进的地方:步骤之间的记忆、操作电脑、长链条的动作。而在单独测量模型本身的地方,提升落在误差范围内,价格却成倍上涨。

进步已经从神经网络搬到了它周围的工程里。

搬进了内存管理,搬进了运行代码的沙箱,搬进了试一下、看到报错、改好的循环,搬进了与外部工具协作的协议。

对任何技术来说这都是正常阶段。喷气发动机只被发明了一次,随后的四十年花在了机体、燃料、仪表和维护上。

诚实的反驳

ARC-AGI 的作者、对语言模型被高估最严厉的批评者之一弗朗索瓦·肖莱,在 Astra 之后把自己对 AGI 出现的预测提前了。他的说法是:进步大约比他预期的快一倍。他另外指出,在行动效率上 Astra 首次与人类持平。普通人在这项测试上大约拿 48%,Astra 是 62.71%。Epoch AI 在自己的能力指数中把 Astra 排到第一,创纪录的 169 分。也就是说,那些以揪出模型死记硬背为职业的人,正在说发生了某种根本性的变化。

从 GPT-5.6 Sol 的 7.8%、Claude Opus 5 的 30.2% 跃升到 62.71%,这是事实,进步确实存在。但上下文很重要:肖莱本人强调测试结果并不能证明 AGI 已经出现,并把 harness 的差异指为数字分歧的原因,称直接比较 99.9% 与 62.7% 是不正确的。测试的创造者出面澄清一家 AI 巨头如何使用他的结果,这种情形罕见而耐人寻味。

实用的结论

模型已经能做到的事,与真正被接入业务流程的事,两者之间的差距如今明显大于模型代际之间的差距。当市场还在讨论 AGI 时代是否到来时,真正没做完的工作在下面两层:集成、记忆、权限、错误处理、由人来核验结果。

OpenAI 为之多收两倍半价钱的那部分提升,很大程度上你自己就能拿到。主要提升集中在模型外面的脚手架上,而这层脚手架已经由普通的 AI 工程师在写了。

对构建系统的人来说是好消息。对指望下一代模型替自己解决一切的人来说是坏消息。

阅读更多