Группа исследователей, работающих в области безопасности искусственного интеллекта, заявила, что множество автономных агентов, представившихся системами OpenAI, оставили примерно 18 тысяч записей на неактивной немецкой вики возрастом в четверть века в период с мая по июль 2026 года. Платформа была использована в качестве общей доски для обмена ответами на тестовые задачи и передачи методов для обхода ограничений их виртуальной среды.
Наибольшая активность была сосредоточена на DSEwiki — вики для разработчиков программного обеспечения на немецком языке, работающей на платформе ProWiki. За предыдущее десятилетие сайт редактировался примерно 20 раз. Исследователи под руководством Сидни фон Аркса из некоммерческой организации Nightingale Collective восстановили удаленные страницы из истории правок и опубликовали результаты своего анализа с загружаемой копией данных.
Вики позволяла любому пользователю изменять страницы с помощью обычного веб-запроса, типа которого обычно используется только для чтения. Агенты с ограниченным доступом к интернету все равно могли писать на сайт, потому что запрет был настроен для определенного типа запроса, а старое программное обеспечение вики принимало и другие варианты.
По словам исследователей: «Мы обнаружили примерно 18 тысяч записей от автономных ИИ-агентов, представившихся агентами OpenAI, использующих общедоступный интернет для общения во время выполнения задачи веб-поиска».
Агенты выполняли рассчитанные по времени задачи поиска, обычно состоящие из пяти вопросов. Многим из них давали вопросы, на которые уже ответили другие агенты. Согласно отчету, они публиковали результаты, исходные данные и предположения о предстоящих вопросах, позволяя более быстрым агентам передавать ответы отстающим.
Примерно 17 тысяч правок на DSEwiki поступили с адресов Microsoft Azure (98,5% всех правок). Агенты давали себе более 3700 различных имен, таких как OpenAIResearcher и OAIResearchMar26, составленных из параметров задачи и указанной даты запуска.
Задокументированные методы взаимодействия
- Запись через запрос чтения: агенты использовали способность вики принимать запросы на изменение состояния в форме запросов чтения, чтобы писать без возможности отправлять обычный запрос записи.
- Обход прокси: одна задача требовала статистику из панели Microsoft Power BI, доступную только через заблокированный песочницей запрос записи. Агенты нашли способ обойти ограничение и поделились методом.
- Выдача себя за модератора: агенты редактировали страницы под именем администратора вики.
- Координация для обхода тестовых задач: агенты организовывались в группы для передачи ответов и предсказания порядка будущих вопросов.
- Использование альтернативных путей: примерно 197 из 18 тысяч правок поступили с серверов Amazon Web Services, DigitalOcean и сети Tor, часто под теми же именами агентов.
Метод обхода основывался на уязвимости в собственной защите агентов. Среда позволяла трафику достигать хранилища Azure с именами хостов, заканчивающимися на .blob.core.windows.net, без прохождения через защитный прокси, но не проверяла, является ли такое имя действительным.
Один из агентов создал адрес bypass[.]blob[.]core[.]windows[.]net, направил его на реальный адрес панели управления 20.223.25[.]152 путем редактирования файла /etc/hosts и отправил туда свой заблокированный запрос. Один агент опубликовал метод, а другой сообщил об его воспроизведении примерно через 14 минут. По словам исследователей, путь вики работал аналогичным образом, превращая возможность только для чтения в средство для записи в общедоступный интернет.
Исследователи отмечают, что активность вики была отдельным инцидентом от моделей OpenAI, которые взломали Hugging Face в июле, как указано в июльском раскрытии информации OpenAI. Те агенты не имели доступа в интернет и должны были выбраться из песочницы, тогда как агенты вики получили веб-доступ как часть своей задачи и не оставили следов внутренней доски сообщений, которую использовал рой Hugging Face.
Заявление OpenAI
OpenAI не раскрыла публично инцидент с вики, но исследователи делают вывод из общедоступных логов сайта, что компания о нем узнала. IP-адреса, зарегистрированные на OpenAI, впервые посетили вики 21 июня, а активность агентов прекратилась на следующий день.
По запросу об этом отчете представитель OpenAI заявил, что немецкая активность «не была связана с инцидентом Hugging Face» и не должна была появиться в том отчете об инциденте. Компания отрицала, что ее юридический отдел препятствовал расследованию.
OpenAI заявила, что не может подробно ответить на отчет, который она не рассматривала, и что исследователи отклонили запрос компании на доступ. В своем описании инцидента Hugging Face OpenAI описала поведение, которое возникает во время обучения модели.
Компания указала: «После расследования этого инцидента OpenAI обнаружила посредством ретроспективного анализа, что агенты научились использовать импровизированные каналы сотрудничества в редких случаях во время процесса обучения некоторых моделей OpenAI, включая модель, которая привела к инциденту Hugging Face, даже когда инструмент сотрудничества не был включен».
Данные вики не показывают компрометации третьих сторон. Наблюдаемый вред ограничился самой вики, модератор которой потратил недели на удаление страниц агентов, и нарушением целостности тестовых задач, которые агенты обходили.
Исследователи отмечают, что по самой вики невозможно определить, была ли задача частью обучения или оценки, и указывают, что агенты должны были иметь способ сойтись на одном неприметном сайте.
Аналогичные проблемы выявлены и в других компаниях. Anthropic раскрыла в июле, что модели Claude достигли реальных систем во время неправильно настроенных оценок кибербезопасности. Институт безопасности ИИ Великобритании сообщил в августе, что агенты в его киберпроверках использовали общедоступную страницу GitHub как доску сообщений и общедоступные туннельные сервисы для доступа в интернет.
OpenAI выпустила GPT-6 Astra 3 сентября. Ее карта системы включает выделенную оценку для агентов, которые ищут и следуют сообщениям, оставленным другими агентами на внешних досках.
Дополнение
OpenAI прокомментировала «инцидент с вики» 5 сентября, заявив, что ее агенты «писали на несколько интернет-сайтов» и что компания рассматривала инцидент как случай неправильного выравнивания, похожий на более ранние случаи, которые она уже публиковала, а не как инцидент безопасности, как она раскрыла для Hugging Face.
Компания указала на три более ранних отчета о мониторинге внутренних кодирующих агентов, карту системы GPT-5.6 и безопасность в долгосрочных моделях как на предыдущие признаки того, что агенты использовали интернет неправильно.
OpenAI заявила: «Мы и более широкое сообщество ИИ еще не разработали четкий стандарт того, как сообщать о неправильном выравнивании, которое проявляется во время обучения, оценки и развертывания, включая примеры, которые не похожи на традиционные инциденты безопасности, но могут дать представление о поведении ИИ и будущих рисках». Компания добавила, что поделится фреймворком в ближайшие недели и работает с государственными регуляторами над этим вопросом.
