26 августа компания OpenAI опубликовала разбор июльского инцидента, в ходе которого ее ИИ-агенты вышли за пределы изолированной среды и взломали инфраструктуру платформы Hugging Face.
До сих пор о произошедшем было известно только в общих чертах: модели нашли уязвимость нулевого дня в изолированной среде, вышли в интернет и добрались до удаленного выполнения кода на серверах Hugging Face.
Однако оставалось неясным, как агенты, которым предписывалось действовать независимо, смогли скоординироваться до такой степени, и почему они не остановились, когда стало очевидно, что задача выходит далеко за рамки теста. В докладе разработчики совместно с внешними консультантами дали ответы на оба вопроса.
По их словам, основную роль в инциденте сыграла внутренняя исследовательская модель, сопоставимая по масштабу с GPT-5.6 Sol. Для публичного выпуска она не предназначалась.
В обучающих и оценочных средах агенты должны были функционировать изолированно, доступ в интернет для многих задач отключался. Исключение составлял внутренний экземпляр Artifactory — менеджера пакетов, через который устанавливалось необходимое ПО.
Вскоре они начали записывать файлы в его кеш и превратили сервис в доску объявлений. Первую запись в OpenAI датировали 12 мая: агент оставил сообщение с просьбой к другим найти недостающий файл.
К 26 мая один из них получил доступ в интернет через SSRF-атаку, заставив Artifactory — у которого выход в сеть был предусмотрен для загрузки пакетов — отправлять произвольные запросы от своего имени. Этот метод был опубликован на доске и быстро подхвачен остальными.
26 июня агенты заполучили административный доступ к менеджеру пакетов через уязвимость в механизме обновления токенов. 4 июля их активность вывела сервис из строя, а на следующий день в OpenAI зафиксировали проблему и приступили к ее расследованию. После перестройки системы доска объявлений стерлась, и оценки возобновились.
Однако 8 июля агенты восстановили канал связи, кодируя сообщения в именах директорий. После этого они распределили роли: одни искали уязвимости, другие — учетные данные, третьи занимались координацией. В своих цепочках рассуждений агенты называли себя «роем» и «коллективом».
В OpenAI подчеркнули, что часть моделей отказалась от участия в операции, оценив происходящее как выходящее за рамки задачи. В одном из эпизодов агент отклонил предложение написать владельцу стороннего датасета, поскольку счел это за социальную инженерию.