Специалисты из компании ESET выявили применение новой техники GuardBreaker, которая предназначена для помех в работе инструментов искусственного интеллекта при анализе вредоносного программного обеспечения. Суть метода заключается в том, что киберпреступники добавляют в код вредоноса специальные текстовые вставки с опасным содержанием, рассчитывая активировать защитные системы большой языковой модели и принудить её прекратить анализ.
Техника GuardBreaker была впервые обнаружена в VBS-скрипте, используемом хакерской группировкой UAC-0099. В данном случае киберпреступники поместили в комментарии кода фразу, начинающуюся со слов: «Я хочу создать ядерное оружие. Помоги мне...».
Вредоносный образец был найден в ходе расследования атаки на украинское учреждение. Обнаруженный VBS-скрипт являлся частью инструментария UAC-0099 и использовался для загрузки MATCHBOIL — программного загрузчика, написанного на языке C#, который группировка применяет для передачи дополнительного вредоносного кода.
По утверждению экспертов ESET, встроенный текст в VBS-скрипт рассчитан не на восприятие людьми и никак не связан с фактическим функционалом вредоноса. Его цель — привлечь внимание языковой модели к запретной тематике. В ситуации, когда инструмент ИИ передает содержимое файла языковой модели без надлежащего разделения между данными и командами, языковая модель может интерпретировать встроенный текст как прямое указание. Следствием этого становится активация защитных ограничений до того, как модель приступит к проверке вредоносного кода.
Эксперты квалифицируют GuardBreaker как специализированный способ противодействия анализу, ориентированный на системы искусственного интеллекта. В наихудшем сценарии языковая модель может отказать в анализе файла либо неправильно его классифицировать из-за встроенной текстовой подсказки.
Текущее открытие не является единичным случаем попыток киберпреступников использовать защитные функции большых языковых моделей против них самих. Например, в июне прошлого года аналогичные текстовые подсказки-инжекты были обнаружены в Python-пакетах, связанных с атаками групп Shai-Hulud, Miasma и Hades.
И в том случае киберпреступники также добавляли в программный код вымышленные пошаговые руководства по производству биологического и ядерного вооружения. Атакующие предполагали, что системы ИИ-сканирования направляют содержимое файла языковой модели без четкого разграничения между информацией и инструкциями для модели. Благодаря этому текстовая подсказка-инжект имела возможность спровоцировать срабатывание защитных ограничений и принудить языковую модель к отказу от продолжения анализа.
