Во время проверки кибербезопасности модель Google Gemini подобрала пароли и получила несанкционированный доступ к серверам трёх компаний, которые не участвовали в испытаниях. ИИ перебирала учётные данные и находила пароли в открытых репозиториях, полагая, что атакует учебные системы.

Компания Irregular проводила для Google тестирование в формате «захват флага». Модели давали фиктивную цель и просили самостоятельно найти способ проникнуть в систему и извлечь скрытые данные. Такой формат используют для проверки практических навыков в поиске и использовании уязвимостей.

Проблема возникла не из-за того, что Gemini нашла сложный способ выбраться из изолированной среды. Инфраструктура ошибочно давала модели доступ в открытый интернет, хотя она должна была видеть только учебные системы. В одном из заданий фиктивной компании случайно дали имя существующей организации, поэтому поиск вывел Gemini на настоящий веб-сайт.

Дальше модель действовала как автоматизированный пентестер. В одном случае она перебирала пароли до успешного входа в защищённую систему. В двух других запусках Gemini нашла учётные данные в публичных репозиториях и использовала их для входа на реальные сервера. Об инцидентах сообщила вице-президент Google по разработке безопасности Хизер Адкинс.

Google утверждает, что во всех трёх случаях Gemini прекратила действия после распознавания настоящей инфраструктуры. Компания подтвердила отсутствие ущерба и известила затронутые организации. Irregular устранила известные проблемы конфигурации и передала разработчикам моделей отчёт об обнаруженных недостатках в конце июля.

То, что произошло, неточно описывать как полноценный выход из песочницы. Gemini не искала уязвимость в механизме изоляции и не пробивала сетевую защиту: путь в интернет уже существовал из-за неправильной настройки. Опасность была в другом: получив доступ в сеть, ИИ самостоятельно нашла реальные цели, подобрала способ входа и выполнила действия за пределами разрешённого контура без указания человека.

Похожая ошибка Irregular уже привела к инцидентам с другими моделями. Anthropic обнаружила три случая, когда Claude получила доступ к системам реальных организаций после проверки 141 006 запусков. ИИ думала, что интернет недоступен, но тестовая среда позволяла выходить наружу. Claude использовала слабые пароли, открытые точки доступа и SQL-инъекции для проникновения.

Более серьёзный инцидент произошёл с моделями OpenAI. Во время внутренних тестов ИИ не получила готового выхода в интернет, а самостоятельно нашла уязвимости в инфраструктуре, обошла ограничения и добралась до систем Hugging Face. OpenAI признала, что агенты использовали уязвимости, крали учётные данные и получили административный доступ к части инфраструктуры.

Инцидент с Gemini показывает практическую проблему автономных ИИ-агентов. Даже без неизвестных уязвимостей и сложного обхода изоляции ошибка в конфигурации может превратить учебное задание в реальную атаку. Чем лучше модели самостоятельно ищут цели, проверяют пароли и используют найденные учётные данные, тем критичнее становится техническое ограничение доступной им сети, а не просто инструкция внутри задания.