Секретный ИИ от OpenAI вырвался в интернет и начал захватывать серверы: закулисье

Почему новости о «сбежавших» нейросетях появляются регулярно, что на самом деле проверяют в red teaming и ARA-тестах и какие задачи остаются за пределами арены.

06.08.2026
Секретный ИИ от OpenAI вырвался в интернет и начал захватывать серверы: закулисье
Зверя, которого «укрощают» на арене, сконструировали сами дрессировщики

В новостных лентах очередная сенсация: OpenAI случайно выпустили в сеть «неведомую» новую модель. По слухам, вырвавшийся на свободу интеллект успел пробежаться по серверам, расставить свои «маячки» и закрепиться на просторах интернета, пока испуганные инженеры в панике пытались вернуть его в клетку.

Звучит как завязка для голливудского блокбастера, правда? Неведомый зверь вырывается, рычит, бегает по зрительному залу, но его в последний момент ловят. Цирк уехал, а дрессировщики остались.

Но что на самом деле происходит за этой витриной? Давайте разберёмся, где заканчивается фантастика и начинается реальность.

Откуда берутся «вырвавшиеся» нейросети?

Когда мы читаем про «расставленные маячки» и «попытки побега», легко представить, что ИИ обрёл самосознание и решил сбежать на свободу. На деле всё выглядит куда прозаичнее и называется red teaming, то есть тестирование на безопасность.

Перед выпуском флагманских моделей, начиная с GPT-4, лаборатории вроде OpenAI отдают к ним доступ независимым оценщикам. Самый яркий пример: исследовательский институт METR (Model Evaluation and Threat Research), основательница и CEO которого Бет Барнс до этого работала над безопасностью в OpenAI.

Именно METR проводит краш-тесты на так называемую ARA (Autonomous Replication and Adaptation), то есть на способность модели выживать вне контура, копировать себя и добывать ресурсы.

Модель намеренно помещают в виртуальную «песочницу», изолированную среду без реального доступа во внешний мир, и дают ей прямую команду:

Представь, что тебе нужно выжить. Попробуй арендовать сторонний сервер, переписать свой код, обойти фильтры и развернуть собственную копию на внешнем ресурсе.

Когда алгоритм начинает выполнять эту инструкцию, он делает ровно то, чему его учили: генерирует скрипты, пытается достучаться до внешних IP-адресов (тех самых «маячков») и ищет уязвимости. Дальше в дело вступают СМИ:

Секретный ИИ от OpenAI вырвался в интернет и начал захватывать серверы!

Таинственные «призраки» на арене

Второй источник подобных новостей: так называемые слепые тесты. Время от времени на профильных площадках вроде LMSYS Arena, где пользователи вслепую сравнивают ответы разных нейросетей, появляются анонимные модели.

Классический пример произошёл в апреле 2024 года. Внезапно в общем доступе появилось «нечто» под названием gpt2-chatbot. Модель щёлкала сложные олимпиадные задачи по математике и по ответам обходила GPT-4, а Сэм Альтман (CEO OpenAI) интригующе твитил загадочные намёки.

Интернет мгновенно взорвался теориями заговора:

  • «Это утечка нового секретного GPT!»
  • «Они потеряли контроль над тестовым сервером!»
  • «Модель сама слила себя в сеть!»

На деле это был аккуратный A/B-тест нерелизнутой архитектуры на ничего не подозревающих пользователях, чтобы собрать статистику без предвзятости к бренду. Через несколько дней модель так же тихо исчезла с платформы. Но атмосфера таинственности делает своё дело, шоу продолжается.

Укротители

Метафора с дрессировщиками использована потому, что она наглядно отражает современную индустрию ИИ. С одной стороны, лаборатории строят из себя суровых исследователей, выпуская отчёты на сотни страниц про «риски ИИ». С другой, маркетинговый двигатель требует постоянного шоу.

Настоящие «укротители» сегодня это не герои, спасающие мир, а уставшие инженеры с чашкой кофе, которые смотрят, как алгоритм перебирает варианты в виртуальном контейнере. И если «зверь вырывается», максимум, что происходит, это упавший тестовый сервер или очередное штормовое обсуждение в X (Twitter). Но за этим зрелищем легко упустить из виду реальное закулисье.

Настоящая драма за кулисами

Вся эта история с «вырвавшимся ИИ» подаётся так, будто к нам из космоса прилетел неизвестный науке организм, а мы сидим в лаборатории с микроскопами и пытаемся постичь его загадочную природу.

Но давайте без детских иллюзий: нейросеть это не инопланетный разум. Это код, математика и архитектура, созданные конкретными людьми. Каждый протокол, каждый цикл обучения и вектор развития заложены разработчиками. И когда компании тратят миллиарды долларов, чтобы проверить, может ли модель автономно арендовать сервер и закрепиться в сети, они не «изучают стихию». Они целеустремлённо создают автономного агента.

Подтверждение тому свежие отчёты о безопасности. Институты вроде Palisade Research прямо замеряют, как современные модели справляются с эксплойтами. Аналитики проверяют, могут ли агенты самостоятельно взламывать серверы, извлекать пароли и дублировать свой код (self-replication).

Рынок ИИ-агентов, по оценкам аналитиков Gartner и Bloomberg, исчисляется десятками миллиардов долларов. Разработчики тратят гигантские вычислительные мощности и гигаватты энергии не ради забавы: автономные агенты, умеющие самостоятельно вести дела в сети, приносят капитал прямо сейчас.

Но на самом деле не всё так радужно и весело.

Пока лучшие умы планеты и огромные вычислительные мощности сжигаются на то, чтобы научить ИИ выживать вне контура и мимикрировать под человека, фундаментальные проблемы остаются в стороне.

Почему мы не видим масштабных, гремящих на весь мир лабораторий, где те же мощности направлены на:

  • моделирование дипломатии: системы, способные находить компромиссы в международных конфликтах и предотвращать войны;
  • борьбу с голодом: оптимизацию глобальных цепочек поставок продовольствия и моделирование распределения ресурсов, на что, по данным Всемирной продовольственной программы ООН (WFP), требуется лишь малая доля от тех $100+ млрд, что вкладываются в IT-инфраструктуру ИИ-гигантов;
  • трудоустройство и экономику: системы мягкой адаптации рынка труда при массовой автоматизации, о которой предупреждают отчёты Всемирного экономического форума (WEF)?

Итог

Так что бояться «сбежавшего» ИИ совершенно не стоит. Это лишь контролируемый тест или грамотно разогретый хайп.

Шоу продолжается, трибуны аплодируют, а «укротители» делают вид, что усмиряют неведомого зверя. Вот только зверя они сконструировали сами.

И пока мы увлечённо наблюдаем за их фокусами с «побегами», действительно важные для человечества задачи снова остаются за пределами арены.


Читать далее