Жажда реальности: разбор GPT-6 Astra
Четыре числа релиза GPT-6 Astra: 99.9 против 62.7, 100 против 39, 61.2 против 60.9 и цена в 2.5 раза выше. Прогресс переехал в обвязку.
Архитектуру Transformer, на которой построены все современные языковые модели, придумали в Google в 2017 году. OpenAI сделала ставку на масштабирование этой архитектуры, когда мало кто в неё верил, и с тех пор выпускает по флагманской модели в год. Вопрос в том, где именно происходит основной прогресс в каждом новом релизе.
3 сентября 2026 года OpenAI выпустила GPT-6 Astra и объявила о наступлении эры AGI. Президент компании Грег Брокман охарактеризовал релиз одной фразой: тест ARC-AGI-3 полностью пройден.
Через несколько часов организация, которая делает этот самый тест, опубликовала своё измерение. Оно отличалось от цифры OpenAI почти на сорок процентных пунктов.
Дальше четыре числа, которые говорят о релизе больше, чем весь маркетинг вокруг него.
Число первое: 99.9 против 62.7
ARC-AGI-3 проверяет способность разобраться в незнакомой интерактивной среде. Модель попадает туда, чего не было в обучающих данных, и должна понять правила по ходу дела. Именно этот навык обычно называют границей между человеком и статистической моделью. OpenAI отчиталась о 99.9%. ARC Prize, организация-автор теста, измерила 62.71%. Обе цифры настоящие, и разница в том, как модель запускали.
Здесь важно сказать о харнессе: это не сама нейросеть, это обвязка, код вокруг модели, внешняя программа, которая запускает модель, хранит её заметки, подаёт задачу кусками и собирает ответ. У OpenAI была своя обвязка: она сохраняла внутренние рассуждения модели между шагами и умно сжимала длинный диалог. У ARC Prize стандартная, одинаковая для всех моделей.
Вердикт ARC Prize: разница вызвана обработкой памяти, но нейросеть в обоих случаях одна и та же. Тридцать семь процентных пунктов прироста дал код вокруг модели, то есть именно харнесс.
Число второе: 100 против 39
ExploitBench проверяет, умеет ли модель находить уязвимости в программах. Astra показала 100%.
Тот же тест, пересобранный без исторических уязвимостей, то есть без дыр, которые уже описаны в интернете и попали в обучающие данные, дал 39%.
Это ровно тот спор, который идёт годами, показанный числом. Там, где задача уже была решена раньше, результат близок к идеалу. Там, где задача действительно новая, он падает в два с половиной раза.
Да, 39% на поиске неизвестных уязвимостей это всё равно много. OpenAI не зря присвоила модели критический уровень киберспособностей и закрыла часть функций от публичного доступа. Но разница между 100% и 39% в первую очередь говорит о хорошей памяти системы на уже известное. О способности находить принципиально новое эта разница говорит куда меньше.
Число третье: 61.2 против 60.9
Artificial Analysis, независимая площадка сравнения моделей, поставила Astra 61.2 балла по общему индексу интеллекта. Предыдущей модели, GPT-5.6 Sol, она поставила 60.9. Три десятых балла за поколение. По агентному кодингу, то есть по задачам, где модель долго работает сама: пишет код, запускает, видит ошибку, чинит, разрыв так же есть: 67.0 против 65.1. Прогресс есть, и он снова там, где модель работает в цикле с внешними инструментами.
Число четвёртое: 2.5x
Согласно официальным тарифам, Astra стоит 10 долларов за миллион входящих токенов и 50 за миллион исходящих. Это в два с половиной раза дороже предыдущего флагмана.
Итого: почти нулевой прирост по общему индексу интеллекта при цене, выросшей в два с половиной раза.
Складываем картину
Прирост появляется там, где улучшили обвязку: память между шагами, работа с компьютером, длинные цепочки действий. Там, где меряют модель в чистом виде, прирост лежит в пределах погрешности, а цена выросла кратно.
Прогресс переехал из нейросети в инженерию вокруг неё.
В управление памятью, в песочницы для запуска кода, в циклы «попробовал, увидел ошибку, исправил», в протоколы работы с внешними инструментами.
Это нормальная фаза для любой технологии. Реактивный двигатель изобрели один раз, а следующие сорок лет занимались планером, топливом, приборами и обслуживанием.
Честный контраргумент
Франсуа Шолле, автор ARC-AGI и один из самых жёстких критиков переоценки языковых моделей, после Astra сдвинул свой прогноз появления AGI ближе. Его формулировка: прогресс идёт примерно вдвое быстрее, чем он ожидал. Отдельно он отметил, что по эффективности действий Astra впервые сравнялась с человеком. Средний человек набирает на этом тесте около 48%, Astra 62.71%. Epoch AI поставила Astra первое место в своём индексе способностей с рекордными 169 баллами. То есть люди, которые профессионально ловят модели на зубрёжке, говорят, что произошло что-то фундаментальное.
Скачок с 7.8% у GPT-5.6 Sol и 30.2% у Claude Opus 5 до 62.71% это факт, прогресс есть. Но тут важен контекст: сам Шолле подчеркнул, что результаты теста не доказывают появление AGI, и указал на разницу харнессов как на причину такого расхождения в цифрах, назвав прямое сравнение 99.9% и 62.7% некорректным. Ситуация, когда создатель теста уточняет, как именно ИИ-гигант использует его результаты, редкая и показательная.
Практический вывод
Разрыв между тем, что модели уже умеют, и тем, что реально внедрено в бизнес-процессы, сейчас заметно больше разрыва между поколениями моделей. Пока рынок обсуждает, наступила ли эра AGI, основная незакрытая работа лежит на два уровня ниже: интеграции, память, доступы, обработка ошибок, проверка результата человеком.
Прирост, за который OpenAI берёт в два с половиной раза дороже, вы во многом можете получить сами. Основной прирост сосредоточен в обвязке вокруг модели, и эту обвязку уже пишут обычные AI-инженеры.
Хорошая новость для тех, кто строит системы. Плохая для тех, кто ждёт, что следующая модель решит всё за них.