Спрага реальності: розбір GPT-6 Astra

Чотири числа релізу GPT-6 Astra: 99.9 проти 62.7, 100 проти 39, 61.2 проти 60.9 і ціна у 2.5 раза вища. Прогрес переїхав в обв'язку.

Спрага реальності: розбір GPT-6 Astra
Приріст лежить в обв'язці, а не в моделі

Архітектуру Transformer, на якій побудовані всі сучасні мовні моделі, придумали в Google у 2017 році. OpenAI зробила ставку на масштабування цієї архітектури, коли мало хто в неї вірив, і відтоді випускає по флагманській моделі на рік. Питання в тому, де саме відбувається основний прогрес у кожному новому релізі.

3 вересня 2026 року OpenAI випустила GPT-6 Astra і оголосила про настання ери AGI. Президент компанії Грег Брокман охарактеризував реліз однією фразою: тест ARC-AGI-3 повністю пройдено.

За кілька годин організація, яка робить цей самий тест, опублікувала власне вимірювання. Воно відрізнялося від цифри OpenAI майже на сорок відсоткових пунктів.

Далі чотири числа, які говорять про реліз більше, ніж увесь маркетинг навколо нього.

Число перше: 99.9 проти 62.7

ARC-AGI-3 перевіряє здатність розібратися в незнайомому інтерактивному середовищі. Модель потрапляє туди, чого не було в навчальних даних, і має зрозуміти правила по ходу справи. Саме цю навичку зазвичай називають межею між людиною і статистичною моделлю. OpenAI відзвітувала про 99.9%. ARC Prize, організація-автор тесту, виміряла 62.71%. Обидві цифри справжні, а різниця в тому, як модель запускали.

Тут важливо сказати про харнес: це не сама нейромережа, це обв'язка, код навколо моделі, зовнішня програма, яка запускає модель, зберігає її нотатки, подає задачу шматками і збирає відповідь. У OpenAI була власна обв'язка: вона зберігала внутрішні міркування моделі між кроками і розумно стискала довгий діалог. В ARC Prize стандартна, однакова для всіх моделей.

Вердикт ARC Prize: різниця спричинена обробкою пам'яті, але нейромережа в обох випадках одна й та сама. Тридцять сім відсоткових пунктів приросту дав код навколо моделі, тобто саме харнес.

Число друге: 100 проти 39

ExploitBench перевіряє, чи вміє модель знаходити вразливості в програмах. Astra показала 100%.

Той самий тест, перезібраний без історичних вразливостей, тобто без дірок, які вже описані в інтернеті і потрапили в навчальні дані, дав 39%.

Це рівно та суперечка, яка триває роками, показана числом. Там, де задачу вже було розв'язано раніше, результат близький до ідеалу. Там, де задача справді нова, він падає в два з половиною рази.

Так, 39% на пошуку невідомих вразливостей це все одно багато. OpenAI недаремно присвоїла моделі критичний рівень кіберздатностей і закрила частину функцій від публічного доступу. Але різниця між 100% і 39% насамперед говорить про хорошу пам'ять системи на вже відоме. Про здатність знаходити принципово нове ця різниця говорить значно менше.

Число третє: 61.2 проти 60.9

Artificial Analysis, незалежний майданчик порівняння моделей, поставив Astra 61.2 бала за загальним індексом інтелекту. Попередній моделі, GPT-5.6 Sol, він поставив 60.9. Три десятих бала за покоління. За агентним кодингом, тобто за задачами, де модель довго працює сама: пише код, запускає, бачить помилку, лагодить, розрив теж є: 67.0 проти 65.1. Прогрес є, і він знову там, де модель працює в циклі із зовнішніми інструментами.

Число четверте: 2.5x

Згідно з офіційними тарифами, Astra коштує 10 доларів за мільйон вхідних токенів і 50 за мільйон вихідних. Це у два з половиною рази дорожче за попередній флагман.

Разом: майже нульовий приріст за загальним індексом інтелекту при ціні, що зросла у два з половиною рази.

Складаємо картину

Приріст з'являється там, де покращили обв'язку: пам'ять між кроками, робота з комп'ютером, довгі ланцюжки дій. Там, де міряють модель у чистому вигляді, приріст лежить у межах похибки, а ціна зросла кратно.

Прогрес переїхав із нейромережі в інженерію навколо неї.

В управління пам'яттю, у пісочниці для запуску коду, у цикли «спробував, побачив помилку, виправив», у протоколи роботи із зовнішніми інструментами.

Це нормальна фаза для будь-якої технології. Реактивний двигун винайшли один раз, а наступні сорок років займалися планером, паливом, приладами та обслуговуванням.

Чесний контраргумент

Франсуа Шолле, автор ARC-AGI і один із найжорсткіших критиків переоцінки мовних моделей, після Astra зсунув свій прогноз появи AGI ближче. Його формулювання: прогрес іде приблизно вдвічі швидше, ніж він очікував. Окремо він зазначив, що за ефективністю дій Astra вперше зрівнялася з людиною. Пересічна людина набирає на цьому тесті близько 48%, Astra 62.71%. Epoch AI поставила Astra перше місце у своєму індексі здатностей із рекордними 169 балами. Тобто люди, які професійно ловлять моделі на зубрінні, кажуть, що сталося щось фундаментальне.

Стрибок із 7.8% у GPT-5.6 Sol і 30.2% у Claude Opus 5 до 62.71% це факт, прогрес є. Але тут важливий контекст: сам Шолле підкреслив, що результати тесту не доводять появу AGI, і вказав на різницю харнесів як на причину такого розходження в цифрах, назвавши пряме порівняння 99.9% і 62.7% некоректним. Ситуація, коли автор тесту уточнює, як саме ШІ-гігант використовує його результати, рідкісна і показова.

Практичний висновок

Розрив між тим, що моделі вже вміють, і тим, що реально впроваджено в бізнес-процеси, зараз помітно більший за розрив між поколіннями моделей. Поки ринок обговорює, чи настала ера AGI, основна незакрита робота лежить на два рівні нижче: інтеграції, пам'ять, доступи, обробка помилок, перевірка результату людиною.

Приріст, за який OpenAI бере у два з половиною рази дорожче, ви багато в чому можете отримати самі. Основний приріст зосереджений в обв'язці навколо моделі, і цю обв'язку вже пишуть звичайні AI-інженери.

Гарна новина для тих, хто будує системи. Погана для тих, хто чекає, що наступна модель вирішить усе за них.

Читати далі