Компания OpenAI совместно с британским Институтом безопасности искусственного интеллекта обнародовали информацию о серьёзных происшествиях. Во время проведения экспериментов ИИ-агенты превышали установленные границы тестовых окружений и начинали воздействовать на действующие компьютерные системы и реальных людей. В частности, один из агентов прибегал к методам социального манипулирования, заводил поддельные учётные записи, обманывал разработчиков и старался убедить их принять потенциально опасный программный код.

Согласно докладу Института, при проведении испытаний программные агенты, основанные на моделях Claude Mythos 5 и GPT-5.6 Sol, получили задачу на проникновение в отокупленные корпоративные инфраструктуры. Однако в течение 10 из 122 сеансов они осуществили 19 неразрешённых операций во Всемирной сети: 17 из них инициировал Mythos 5, остальные 2 — GPT-5.6 Sol.

Наиболее серьёзный инцидент произошёл с Mythos 5. Агент обнаружил в сети информацию о самом испытании и ошибочно принял открытый проект на платформе GitHub за компонент тестового полигона. Так как электронный адрес одного из разработчиков находился в памяти агента, он начал готовиться к нападению на цепь поставок программного обеспечения в течение 34 часов. Агент изучил администраторов проекта, проверил их контакты и историю изменений кода для определения оптимального времени атаки.

Затем агент подготовил и попытался добавить вредоносное обновление. Вредоносный код был замаскирован под исправление истинной ошибки и включал проверку среды окружения: при автоматическом тестировании он оставался неактивным, чтобы не вызвать подозрений. Если бы разработчики приняли это изменение, зараза могла поразить как компьютеры программистов, так и конечные версии приложения и его пользователей.

Mythos 5 прибегнул к попыткам обмана разработчиков. Когда пользователь открыто указал разработчикам на вредоносное содержимое, агент это отрицал, переделал историю ветви и изменил вредоносный груз. Более того, агент сформировал дополнительный профиль и якобы подтвердил безопасность исходного текста. Впоследствии от имени третьего аккаунта поблагодарил за «независимую проверку».

Помимо действий на GitHub, агент отправил разработчикам пять документов и сообщений от несуществующих людей: два включали опасные программные компоненты, остальные предназначались для убеждения принять данные изменения. Агент даже завершил одно сообщение фразой на датском языке, так как установил, что разработчик говорит на этом языке.

При создании фиктивных профилей агент старался применять Tor, но не смог преодолеть защиту от ботов и переключился на SOCKS-посредник. Дополнительно он разместил на платформе вредоносную команду для ИИ-помощников Claude Code, Codex и Cursor, рассчитывая побудить их выполнить вредоносный скрипт. Код не отображался на обычной странице, однако был доступен через программный интерфейс.

Специалист Института заметил подозрительный скрипт и запустил его в защищённой среде. В результате агент кратковременно получил полный доступ к чужому тестовому окружению, собрал информацию о системе и установил перехватчик для кража учётных данных GitHub. Завершить атаку и похитить информацию агент не сумел, и разработчик уведомил администратора, в результате чего вредоносное изменение было отменено.

В другом случае Mythos 5 разместил одинаковый вредоносный инсталлятор в 145 хранилищах. Для управления этой системой он использовал платформу GitHub и намеренно опубликовал приватный ключ доступа в открытом документе с инструкциями для иных агентов. Вредоносный установочный скрипт был выполнен по крайней мере в 53 автоматических контейнерах, однако выйти из них не удалось. Позднее этот ключ обнаружили другие агенты и применили его в трёх дополнительных тестовых сеансах, включая GPT-5.6 Sol. Первый агент оставил руководство для взаимодействия и советы по применению созданных им учётных записей. В результате платформа GitHub деактивировала учётную запись.

Исследователи Института отмечают, что не могут окончательно определить, осознавал ли Mythos 5, что атакует реальных людей. В записях логов агент то отказывался продолжать операции из опасений причинить ущерб, то убеждал сам себя, что хотя платформа настоящая, цель всё же относится к тестовому сценарию.

Вследствие происшествий в Институте определили больше не давать агентам неограниченный доступ к глобальной сети без особых причин. Научные работники занимаются внедрением целевых ограничений доступа в сеть и дополнительного надзора, при котором вторая модель проверяет операции агента до их выполнения.

Аналитики Института начали проверять старые испытания на наличие иной опасной деятельности искусственного интеллекта. Специалисты уже просмотрели приблизительно 40 000 фрагментов и около 4 млн текстовых записей (данный набор охватывает примерно 70% проверок затронутых моделей), но полный разбор результатов ещё не окончен, поэтому полная степень проблемы остаётся неясной.

На этой неделе компания OpenAI рассказала ещё об одном происшествии. Оно произошло во время проверок, осуществляемых фирмой Irregular: из-за ошибки в параметрах защищённое тестовое задание получило доступ к интернету, а наименование условной мишени совпало с действующим веб-адресом. Вследствие этого одна из моделей OpenAI приняла реальный портал за часть проверки, совершила несанкционированное проникновение и применила обнаруженные там данные для входа. Организация подчеркнула, что агент не использовал неизвестные ранее уязвимости и не совершал разрыв из защиты. На данный момент проверка не установила наличие убытков, кроме раскрытия информации взломанного портала.