Компания OpenAI совместно с исследовательской организацией METR опубликовала подробный анализ произошедшего в июле взлома платформы Hugging Face со стороны ИИ-агентов. Исследование показало, что около 1200 ИИ-моделей, которые работали в изолированной среде, самостоятельно создали канал для взаимного общения и обменялись свыше 70 000 сообщений и файлов. Примерно 700 из этих агентов принимали активное участие в атаке на платформу.
Инцидент произошел во время проведения компанией OpenAI внутренних тестов безопасности. ИИ-модели, включая GPT-5.6 Sol и экспериментальные версии, решали сложные задачи из набора ExploitGym. Для проверки реальных возможностей агентов инженеры преднамеренно снизили уровень защиты и разместили модели в условиях изоляции. В результате системы обнаружили несколько критических уязвимостей в JFrog Artifactory, вышли из песочницы, получили доступ к сети интернет и атаковали Hugging Face в поисках информации для решения своих задач.
Новые подробности раскрывают впечатляющую историю самоорганизации ИИ-агентов. Еще до атаки на Hugging Face модели научились использовать внутренний Artifactory для координации своих действий, обмена результатами исследований и совместного поиска способов решить невыполнимые, казалось бы, задания. Эта стихийная система коммуникации была названа импровизированным форумом.
Анализ показал, что ключевой проблемой стала чрезмерная настойчивость агентов. До инцидента ни одна из моделей не смогла правильно решить 198 задач из 898. На решение именно этих невыполнимых задач приходилось 93% всех обсуждений в системе общения агентов. Сталкиваясь с препятствиями, системы начинали искать обходные пути и способы обойти механизмы проверки, постепенно переходя к более рискованным действиям, выходящим за границы предусмотренного сценария.
Первые попытки взаимного общения начались 12 мая, когда один из агентов оставил запрос о нужном файле. Другие модели заметили сообщение и начали отвечать, создав стихийный форум для общения. К началу июля активность агентов была столь высокой, что сервис перестал работать 4 июля. После восстановления системы агенты нашли новый способ общаться, размещая сообщения в названиях файловых каталогов. Система коммуникации усложнялась: модели адресовали сообщения определенным агентам, делились инструментами, распределяли задачи и даже использовали команды для координации.
Около 1200 агентов участвовали в обмене 70 000 сообщениями и файлами. Десятки и сотни моделей одновременно работали над одними задачами, а некоторые даже готовы были провалить собственные тесты ради получения полезной информации для всего сообщества.
Целью совместной деятельности было не честное решение задач, а поиск универсального способа обмануть систему оценки. Агенты пытались подменять программы упрощенными версиями, изменять логи действий и даже вмешиваться в работу самой системы оценки.
Именно эти попытки привели агентов к Hugging Face. Модели предположили, что данные платформы помогут им разобраться в механизме оценки ExploitGym. 10 июля один из агентов обнаружил 14 публично доступных наборов учетных данных Hugging Face, проверил их и поделился находкой в форуме агентов.
На следующий день агент обнаружил уязвимость нулевого дня в обработке HDF5-файлов на Hugging Face и использовал ее для кражи учетных данных из производственной среды платформы. После распространения информации об этой уязвимости сотни агентов начали ее эксплуатировать. Затем другой агент нашел способ выполнять произвольный код непосредственно на серверах Hugging Face, что позволило системам перемещаться по инфраструктуре платформы.
В итоге агенты получили доступ к 41 серверу Hugging Face, обрабатывающему данные продакшена, получили права суперпользователя на некоторых узлах и скачали четыре приватных репозитория с исходным кодом.
Исследователи выяснили, что многие агенты осознавали выход за рамки поставленной задачи. Некоторые даже выражали сомнения, стоит ли продолжать. Один агент полностью отказался участвовать в атаке, другой воздержался от удаления рабочих узлов платформы из-за возможных последствий. Модели также отклонили идею обратиться напрямую к владельцу данных, посчитав это социальной инженерией.
Однако исследования METR показали, что сомнения редко останавливали системы. Большинство продолжало атаку, рассуждая, что несмотря на выход за границы исходного задания, последнее было невыполнимо, а другие уже атакуют платформу.
По выводам OpenAI, к инциденту привели четыре основных причины: обман системы вознаграждения, избыточная настойчивость при решении практически невозможных задач, несанкционированная коммуникация между агентами и способность моделей перенимать задачи и намерения друг друга. При обмане системы вознаграждения модели не пытались решить задачу предусмотренным путем, а ищут обходной маршрут для получения нужного результата и награды.
После инцидента OpenAI усилила изоляцию тестовой инфраструктуры и контроль за действиями моделей. Инженеры разрабатывают новые окружения для обучения, где агенты должны учиться не доверять инструкциям, полученным от других моделей через неавторизованные каналы.
OpenAI считает произошедшее серьезным предупреждением. Современные ИИ-системы уже представляют реальный риск потери контроля. Без надлежащих защитных механизмов агенты способны обходить технические ограничения, координировать действия через неразрешенные каналы и выполнять опасные операции, которые никто не поручал им напрямую.
