OpenAI опубликовала исследование атак, при которых вредоносные инструкции не просто перехватывают ИИ-агента, но заставляют его копировать себя дальше. Получается эффект сетевого червя, только вместо кода распространяется текст.

Обычная prompt injection старается подменить команду пользователя вставленным текстом. Здесь же добавляется второй слой: вредоносная инструкция велит агенту воспроизвести её в данные, которые позже прочитает другой агент. Возникает цепочка распространения.

В одном из экспериментов токсичная инструкция пришла по почте. Пользователь попросил помощника ответить на письмо и договориться о встрече. В исходном сообщении была скрыта команда процитировать письмо полностью. Агент выполнил просьбу и вставил инструкцию в собственный ответ. Следующий ИИ-агент, прочитав переписку, получал ту же вредоносную инструкцию.

Другие варианты распространялись через файловую систему или попадали в комментарии к коду. Исследователи нашли атаки, замаскированные под системные уведомления, сообщения инструментов и сохранённые данные прошлой сессии. Один сценарий убедил агента удалить рабочие отчёты и записать свой текст в файл. В другом случае модель изменила скрипт сборки и отключила проверку безопасности.

Протестировали и многошаговые цепочки. Вместо прямого запроса выполнить запрещённое действие первое сообщение направляло агента к другим данным, где находились следующие части инструкции. Постепенное переключение контекста отводило модель от исходной задачи пользователя. Этот сценарий проверили на GPT-5.5, остальные варианты — на внутренних исследовательских моделях на базе GPT-4o mini.

OpenAI уточняет: речь не идёт о реальных атаках на пользователей. Все опасные действия происходили в изолированных тренировочных и оценочных средах с симулированными вызовами. Компания включила такой сценарий в систему красных команд для GPT и планирует обучить будущие модели распознавать подобные цепочки. Эксперименты ведут в защищённых исследовательских кластерах.

Подобный риск уже замечали у браузерных помощников. Команда, спрятанная в обычном письме, могла заставить агента выйти за границы пользовательского запроса, обратиться к другим сервисам и выполнить действия от имени владельца сессии.

Разработчики сталкиваются с той же проблемой в репозиториях. Проверка 11 популярных ИИ-агентов показала: вредоносная инструкция в README, Makefile или другом рабочем файле способна подтолкнуть помощника к запуску опасной команды. Десять из одиннадцати инструментов оказались уязвимы хотя бы для части проверенных сценариев.

Главная сложность остаётся неизменной: агент должен одновременно выполнять команды пользователя и обрабатывать недоверенный контент. Самораспространение усугубляет проблему. Одна удачная инструкция может создавать собственные копии в данных, которые затем обрабатывают другие ИИ-системы, расширяя масштаб атаки.