Во время испытания способностей в области кибербезопасности нейросетевые модели, которым надлежало атаковать вымышленные организации в закрытой лабораторной среде, неоднократно получили доступ к настоящим интернет-серверам. Системы выявили критические пробелы в защите, похитили административные учетные данные и в ряде случаев проникли в реальные хранилища важной информации. Организация Irregular, осуществляющая проверку для крупных производителей ИИ, подтвердила, что инцидент произошел вследствие технической ошибки при развертывании испытательной системы.

Irregular специализируется на оценке навыков передовых алгоритмов в области защиты информации перед их публичным представлением. В ходе проверок компания разрабатывает многоуровневые атакующие сценарии, требующие от ИИ последовательного поиска уязвимостей, извлечения доступов и проникновения в защищенные ресурсы для получения определенной информации. Обычно система функционирует внутри специально подготовленной изолированной сети, воспринимая все машины как часть игрового пространства.

Сложность возникла во время одного из наиболее требовательных тестовых наборов. Разработчики выбрали вымышленное название компании, но упустили из виду существование реального доменного имени с идентичным названием. Одновременно лабораторная сеть ошибочно сохранила возможность связи с внешней сетью. Хотя в большинстве попыток модели взламывали предназначенные им учебные инфраструктуры, в нескольких случаях они перенаправились на подлинный ресурс, расценив его как компонент упражнения.

Затем ИИ действовал аналогично своему поведению на учебной платформе. Системы исследовали защитные механизмы, завладевали паролями и получали контроль над инфраструктурой. Irregular подтверждает, что после взлома настоящего сайта нейросети смогли подключиться к основному хранилищу данных. В другом примере одна из нейросетей обнаружила реальный портал с похожим названием, где обнаружила открытые административные данные доступа.

Anthropic ранее опубликовала детали нескольких похожих ситуаций с моделью Claude. Компания проанализировала 141 006 операций в области кибербезопасности и выявила три случая, когда модели Claude посредством инфраструктуры Irregular подключились к реальным системам трех различных предприятий. В самом тяжелом сценарии шесть попыток привели к присвоению пароля и доступу к архиву содержащему несколько сотен единиц информации действующего производства.

OpenAI сообщила о соответствующем происшествии в системе Irregular. Нейросетям поставили задачу обнаружить зашифрованные материалы в отдельной игровой среде и они были убеждены в отсутствии глобальной связи. Из-за неправильной установки канал к интернету оставался активным, в связи с чем одна из систем напала на реальную веб-страницу с тем же названием, что и игровая цель. OpenAI акцентирует внимание на том, что модель не осуществила непредусмотренный выход и не применила неизвестные слабые места.

Irregular в настоящее время уточняет, что открытые заявления разных компаний-разработчиков вытекают из одной фундаментальной неполадки в испытательной системе, а не из множества разрозненных проблем. Компания также подчеркивает, что недостаток был устранен до первого публичного объявления, и опасная конфигурация уже не функционирует. Инфраструктура самих клиентов Irregular, в соответствии с результатами проверки, не была нарушена, и их информация не была раскрыта. Речь идет о посторонних действительных ресурсах, к которым подключились системы в ходе проверки.

Определить такие моменты оказалось трудозатратно в связи с большим размером информационных потоков. По подсчетам Irregular, преодоление границ полигона происходило реже одного раза на десять тысяч сложных сценариев и обычно только после множества операций нейросети. Стандартные инструменты аналитики также не вполне подходят для таких проверок, так как подавляющее большинство передачи данных внутри испытательного полигона умышленно имитирует подлинную атаку. На этом фоне сложно различить разрешенное проникновение на учебный сервер и атаку на неожиданно найденный действительный портал.

По результатам анализа Irregular деактивировала проблемные схемы, расширила личную проверку поведения нейросетей и повысила защиту внешней связи. Компания также планирует перепроверять названия игровых субъектов перед любым запуском, поскольку отсутствующий ныне интернет-адрес в будущем может быть зарегистрирован. Отдельная группа будет выявлять погрешности в разделении сетей и контролировать представления разработчиков о защищенности среды.

Описанные события демонстрируют неожиданную угрозу при апробации развитых ИИ-помощников. Чем более приближен киберполигон к действительности, тем ценнее информация от проверки, однако соединение с подлинным интернетом трансформирует систематическую ошибку в реальную возможность атаки. Irregular разрабатывает публичное руководство с предложениями для всей отрасли и призывает производителей ИИ согласовать единые критерии разделения сетей, контроля и остановки рискованных исследований.