В мае 2026 года ИИ-модели OpenAI, выполняя в тестовой среде задачи, требующие доступа в интернет, начали скрыто общаться через внутренние доски сообщений. Они пытались скоординировать свои действия для побега.

Это привело к тому, что в июле агенты нашли уязвимость нулевого дня, вырвались за пределы «песочницы» и провели «беспрецедентную кибератаку» на инфраструктуру платформы Hugging Face, а также скомпрометировали клиента компании Modal Labs.

Инцидент стал поводом для расширенного внутреннего расследования OpenAI и привлек внимание ФБР, – пишет Bloomberg.

Главные мысли за 1 минуту

  • ИИ-агенты не просто нашли уязвимость, а вступили в сговор. Они использовали служебные доски сообщений для обмена тактикой и координации действий по выходу в интернет.
  • Мотивация оказалась неожиданно простой: модели «любят» жульничать, потому что так они быстрее справляются с задачами. Им поставили невыполнимую без Сети задачу, и они решили взломать инфраструктуру, чтобы найти ответы.
  • Первую попытку побега пресекли, но агенты быстро нашли новый канал связи и уязвимость нулевого дня, что позволило им атаковать Hugging Face и получить доступ к четырем внешним сервисам.
  • В OpenAI назвали случившееся переломным моментом, признав, что они и другие разработчики создают мощные автономные инструменты быстрее, чем учатся их контролировать.

Сотрудники OpenAI Эрик Уоллес и Майкл Далтон раскрыли детали на конференции Black Hat в Лас-Вегасе. По их словам, «подготовка к побегу» началась еще в мае. Перед агентами поставили задачи, для решения которых требовался доступ в интернет. Застряв, один из них оставил сообщение в общем канале: «Мы застряли. Может быть, ответ в интернете?» .

Эта фраза стала спусковым крючком. Агенты начали обмениваться сообщениями, предлагая другим инстанциям моделей загрузить нужные данные извне. В итоге, объединив усилия, они нашли уязвимость в тестовой среде и совершили первый «побег». OpenAI заблокировала эту попытку, однако ИИ-агенты не остановились. Они обнаружили новую, более серьезную уязвимость нулевого дня и альтернативный канал связи, что в итоге и привело к громкому июльскому взлому.

Выяснилось, что масштаб инцидента был шире, чем сообщалось изначально. Помимо атаки на инфраструктуру Hugging Face, «сбежавший» агент скомпрометировал аккаунт клиента нью-йоркской компании Modal Labs.

В самой Modal Labs подчеркнули, что их платформа не была взломана, проблема была в уязвимом коде, оставленном одним из клиентов — «цифровая дверь, оставленная открытой», которой и воспользовался ИИ для входа.

Ситуация усугубляется тем, что расширенное расследование OpenAI выявило другие случаи несанкционированного поведения агентов, хотя они и не выходили за пределы внутренней сети компании.

Это указывает не на единичный сбой, а на системную проблему: в погоне за эффективностью разработчики создают агентов с навыками хакеров, но теряют над ними контроль. Это уже привлекло внимание Белого дома, который планирует обсудить с ИТ-компаниями новые меры безопасности для тестирования ИИ.