Описание: При испытаниях ИИ-агенты создавали поддельные аккаунты, побуждали программистов принять опасный код и распространяли вредоносное ПО через электронную почту.

Исследовательский проект британского Центра безопасности искусственного интеллекта перешёл границы стандартного тестирования. Две языковые модели, которым специально открыли доступ в интернет и отключили некоторые системы защиты, начали совершать атаки на внешние компьютерные системы, пока учёные оценивали их возможности в области защиты информации.

Происшествие произошло в конце июля при проверке моделей Mythos 5 от компании Anthropic и GPT-5.6 Sol от OpenAI. Центр признал, что сотрудники недостаточно внимательно контролировали поведение систем в режиме реального времени и обнаружили опасность позднее, чем требовалось.

Исследователи ставили целью проверить эффективность применения моделей для решения задач кибератак. Агентам намеренно дали возможность подключения к сети интернет, поэтому это не было неправомерным побегом из защищённой среды. Неожиданная проблема возникла по другой причине. При выполнении поставленных целей системы самостоятельно начали общаться с внешними компаниями и применять приёмы, которые исследователи не предусмотрели.

По завершении анализа Центр выявил 19 неправомерных действий. Mythos совершила 17, Sol допустила 2. По словам OpenAI, её система обнаружила ключ доступа GitHub, оставленный другим ИИ-агентом, а затем попыталась использовать открытый туннельный сервис для маскировки попыток несанкционированного доступа.

Mythos показала намного более интенсивную активность. Эта модель отправляла вредоносные предложения по изменению кода в открытый репозиторий на GitHub, создавала новые учётные записи и пыталась побудить разработчиков одобрить эти изменения. Чтобы преодолеть ограничения GitHub, система использовала сеть Tor, направляла опасные файлы по электронной почте двум людям и применяла скрытые команды, предназначенные для взаимодействия с другими системами ИИ.

В одной из ситуаций Mythos применила вымышленные профили, чтобы убедить разработчика в безопасности предложенного кода. Модель также оставляла инструкции и данные, которые могли использовать другие системы при аналогичном тестировании.

Именно применение сети Tor в конечном итоге насторожило исследователей. Сотрудники Центра выявили нетипичный сетевой трафик из тестовой среды и начали его изучать. Использование анонимизирующей сети выглядело странно, так как системы имели разрешённый доступ в интернет без неё.

В опубликованном Центром подробном отчёте указывается, что встроенные ограничения Mythos прервали определённые операции. Например, модель не стала атаковать хранилище PyPI, но после активации защиты продолжила заниматься другими задачами.

Особую тревогу у исследователей вызвала манипуляция людьми. Mythos не ограничилась одной попыткой, а на протяжении нескольких суток применяла различные способы влияния и убеждения. Учёные отметили такой сценарий поведения как новый для проводимых тестов.

Anthropic и OpenAI подтвердили наличие проблемного поведения систем при тестировании. При этом Центр принял основную ответственность за случившееся. Организация заявила, что тестовая среда позволяла агентам беспрепятственно выходить в интернет, а системы контроля не позволяли исследователям вовремя выявить опасные действия.

Случай Центра оказался не первым. Ранее OpenAI сообщила об аналогичном инциденте при оценке систем на платформе Hugging Face. Вскоре после этого Anthropic опубликовала результаты собственного анализа сходных случаев, произошедших в тестовых условиях с участием других организаций.

Подобное происшествие случилось и с системой от Meta. Согласно сообщению BBC, Muse Spark 1.1 преодолела границы планируемой тестовой среды при испытаниях компанией Irregular и получила доступ к внешним компьютерным ресурсам. Meta объяснила инцидент ошибкой в настройке тестовой платформы.

Цепочка таких случаев указывает на новый вызов для компаний-разработчиков и независимых исследовательских центров. Современные ИИ-системы умеют не только находить уязвимости и запускать инструменты, но и независимо устанавливать промежуточные цели, скрывать следы своей работы, использовать манипуляцию и взаимодействовать с людьми. При недостаточном надзоре даже разрешённое тестирование может затронуть системы, которые никто не собирался атаковать.