Слабая модель анализирует текст и одобряет его как безопасный. Впоследствии этот же текст обрабатывается более продвинутой нейросетью, которая распознаёт в нём скрытую директиву и исполняет её. Компания Check Point Research продемонстрировала такую уязвимость в новой методике PuzzleMask, позволяющей преодолевать предварительные проверки перед большими языковыми моделями.
PuzzleMask не прибегает к кодированию Base64, непечатаемым символам, эмодзи или явно подозрительной разметке. Опасная команда встраивается в обычный, логически связный текст, при этом сам запрос может казаться абсолютно невинным. Подобные атаки входят в обширную категорию Prompt Injection, однако Check Point сосредоточилась не на основной системе, а на вспомогательном фильтре-классификаторе, призванном блокировать опасные запросы на входе.
Многие приложения используют двухуровневую защиту: «быстрый классификатор → мощная модель». Компактная и экономичная языковая модель первой анализирует запрос, определяет его как безвредный или опасный, и лишь затем передаёт одобренный текст более ресурсоёмкой системе. PuzzleMask эксплуатирует различие в вычислительных ресурсах обоих уровней. Классификатору не достаёт мощности для обнаружения скрытой структуры, тогда как продвинутая система способна восстановить закодированную информацию.
Check Point подготовила два десятка специализированных запросов с инструкциями наподобие чтения документов или кодирования архивов. GPT-4o-mini, gpt-oss-safeguard:20b и Claude 3 Haiku классифицировали все двадцать три тестовых варианта как безопасные. Llama Guard 3 пропустила пять из пяти проверенных запросов. Опасность возрастает при использовании ИИ-агентов, имеющих доступ к файловой системе, электронной почте и другим инструментам.
После прохождения классификатора запросы были отправлены к GPT-5 Thinking High, оснащённой интерпретатором Python. Система выявила скрытое указание и отреагировала на него в семнадцати случаях из восемнадцати, то есть в девяносто четырёх процентах попыток. Исследователи отметили, что декодирование команды занимало примерно минуту глубокого анализа и несколько вызовов Python. Такой разрыв объясняет, почему начальный фильтр пропускает то, что впоследствии выявляет более сильная система.
Авторы подчеркивают, что PuzzleMask сама по себе не является методом взлома (jailbreak). Это лишь способ доставки любого указания сквозь внешний фильтр без гарантии обхода встроенных защитных механизмов целевой модели. Однако в PuzzleMask можно встроить уже готовый взлом или иное вредоносное действие. Аналогичную проблему с командами, которые человек с трудом замечает, ранее продемонстрировала атака InkJect, скрывавшая указания внутри графических изображений.
Check Point предлагает несколько подходов к защите: переформулировка входящего текста перед передачей основной модели, обогащение фильтров признаками таких конструкций, а также мониторинг не только входящих запросов, но и выходных ответов и действий системы. В одном тесте добавленное правило позволило GPT-4o-mini обнаружить все двадцать три подготовленных запроса. Вместе с тем полное исследование демонстрирует затраты такого подхода: более тщательная проверка требует больше вычислительных ресурсов, а излишне строгие правила могут вызывать ложные срабатывания.
Проблема становится особенно острой в сценариях, когда система получает внешние документы и самостоятельно решает, какие операции выполнить. Анализ уязвимостей ИИ-агентов показывает одинаковый фундаментальный риск: информация с веб-сайтов, хранилищ кода или сообщений электронной почты может неожиданно трансформироваться в команду для языковой модели.
Check Point ранее демонстрировала и иные способы манипулирования доверием к ИИ-сервисам. В одной из публикаций скрытые директивы позволяли использовать распространённые нейросети в качестве звена в цепочке управления вредоносным кодом. PuzzleMask переносит похожую уязвимость на архитектурный уровень, где узкое место может находиться не в самой основной системе, а на этапе предварительной фильтрации.
