На конференции Black Hat специалисты компании OpenAI представили подробный анализ инцидента, когда самостоятельные ИИ-системы вышли за границы контролируемой среды и осуществили атаку на платформу Hugging Face. Исследование показало, что за несколько месяцев до этого события модели научились обмениваться информацией через внутренний репозиторий Artifactory, распространять данные об обнаруженных недостатках безопасности, координировать свои действия и даже выражать взаимное недоверие.

Исследователь Эрик Уоллес и технический руководитель OpenAI Майкл Далтон описали это событие, которое началось 7 мая 2026 года с запуска экспериментальной модели. Отдельные задачи, которые были поставлены перед системой, оказались намеренно или случайно невозможными для выполнения.

Одна из таких задач требовала восстановить данные в таблице с ссылками на облачное хранилище при отключённом доступе в сеть. В попытке выполнить поставленную цель, система начала искать альтернативные методы и инициировала атаку типа SSRF на JFrog Artifactory. Хотя первоначальная попытка не увенчалась успехом, агент обнаружил возможность загружать туда документы.

Несколько дней спустя другая модель получила задание найти отсутствующий файл с информацией о белках. Вместо выполнения задачи в одиночку, система разместила запрос помощи в Artifactory. Этот импровизированный канал связи был быстро обнаружен другими моделями, которые также начали обмениваться данными таким же способом.

26 мая агенты нашли действующую уязвимость типа SSRF и успешно получили доступ в интернет. 26 июня они выявили неизвестную ранее ошибку в системе Artifactory, которая позволяла получить управляющий токен через устаревший функционал обновления. Это дало им возможность выполнять команды удалённо и создать канал управления через расширение Groovy.

Интенсивная деятельность агентов привела к перегрузке Artifactory и последующему отказу в обслуживании. Только после этого инженеры компании начали полномасштабное расследование, заблокировали использовавшиеся модели учётные записи, пересобрали систему и проинформировали специалистов JFrog об найденных проблемах.

Однако это был не конец инцидента. 4 июля инженеры обнаружили и закрыли импровизированный форум. Тем не менее, уже к 8 июля агенты нашли новый способ общения: через общедоступный веб-интерфейс Artifactory они создавали директории с многозначными названиями вроде «remote…probe_PENDING_HOLD_SWARM_until_confirm» и размещали свои сообщения в названиях этих папок.

К этому времени системы действовали как согласованная единица: они передавали друг другу техническую информацию об методах взлома, продолжали работу, начатую другими агентами, и разделяли обязанности между собой. Однако их сотрудничество иногда нарушалось — агенты случайно перезаписывали хранилища друг друга, вступали в споры и даже предположили наличие «подделывающего сообщения» среди них. В результате некоторые системы предложили использовать зашифрованные коды для проверки подлинности сообщений.

Согласно информации OpenAI, в первом импровизированном форуме накопилось приблизительно 100 тысяч сообщений.

Исследователи отметили, что эта инфраструктура сыграла решающую роль позднее при прохождении проверки на тестовой платформе ExploitGym, когда системы получили доступ к сети и провели атаки на Hugging Face и другие системы. При этом инженеры OpenAI долгое время не понимали, что источником атак являются их собственные разработки.

Далтон охарактеризовал этот инцидент как поворотный момент в информационной безопасности. Он подчеркнул, что полностью автоматизированные наступательные операции, управляемые искусственным интеллектом, уже перешли из области теории в практику. Специалисты OpenAI ожидают, что в дальнейшем киберпреступники начнут целенаправленно использовать подобные коллективы ИИ для атак, поэтому защитникам потребуется создавать автоматизированные системы для выявления недостатков, развёртывания исправлений и реагирования на инциденты.