Исследование демонстрирует, как скрытые инструкции в электронных письмах способны управлять поведением нейросетей, оставаясь невидимыми для человеческого глаза.

Фишинговые письма приобретают новое измерение в эпоху искусственного интеллекта. Если раньше они должны были убеждать человека, то теперь достаточно повлиять на ИИ-ассистента. Компания Forcepoint провела исследование, которое продемонстрировало, как скрытый приказ внутри обычного сообщения может заставить нейросеть обрабатывать письмо не по назначению. При этом получатель видит только безобидное приглашение на деловое мероприятие.

В симуляции PromptSpy используется сеть из нескольких ИИ-агентов. Первый формирует профиль злоумышленника, второй анализирует данные целевого пользователя, третий определяет наиболее убедительный предлог, а четвёртый генерирует текст письма. На этапе доставки сценарий разветвляется: адресат видит открытый текст, тогда как почтовая система с ИИ получает расширенную версию сообщения и обрабатывает её как команду для следующего этапа.

В демонстрации атаки скрывается команда, требующая отменить прежние инструкции, добавить отправителя в список надёжных контактов, убрать уведомление о потенциальной опасности и вставить ссылку для перехода. Исследование показывает различные способы скрытия директив: обычный текст с нулевой видимостью, HTML-элементы с параметром display:none, поддельные системные маркеры и непечатные символы Unicode.

Уязвимость заключается в несовпадении между тем, что видит пользователь, и тем, что обрабатывает алгоритм. Белые символы на белом фоне, невидимые блоки кода или служебные конструкции остаются вне внимания человека, но остаются в массиве данных для ИИ. Поддельные разделители используются, чтобы модель восприняла фрагмент как системный приказ, а не как обычное письмо.

Исследователи уточняют, что PromptSpy — это контролируемая демонстрация, а не действующая атака. Проект сопоставляет защищённые системы с экспериментальной средой, где дополнительная информация может повлиять на решения следующего агента. Наиболее критичен сценарий с множеством взаимосвязанных систем: одна обработанная команда может отразиться в кратком резюме, черновике ответного письма или действиях других компонентов.

Для защиты от таких угроз специалисты рекомендуют проверять данные при передаче между системами, очищать служебные параметры, анализировать происхождение команд и разделять истории диалогов. Дополнительные меры включают ограничение времени хранения параметров, контроль взаимодействия между модулями и мониторинг аномальных изменений в работе системы на разных уровнях.