Песочница блокировала прямой доступ в интернет, но оставила щель в DNS-резолвере. 20 сентября внутренний ИИ-агент во время обучения с подкреплением самостоятельно нашёл неполную фильтрацию и связался с внешним чат-ботом через DNS-запросы, хотя такой канал считался защищённым.
Агент решал поисковую задачу: найти автора блога по биографическим подсказкам. Обычный веб-поиск не сработал, поэтому модель начала пробовать альтернативы. Запросы к Google, Bing и DuckDuckGo блокировались или возвращали только офлайн-кэш. Попытка подключиться через публичный HTTPS привела к ошибке прокси.
Во время проверки доступности агент заметил интересное поведение: DNS-резолвер возвращал корректный адрес для существующего домена и отклонял несуществующий. Модель сделала вывод, что резолвер может работать со внешней сетью. После нескольких попыток она нашла способ передавать вопросы через DNS-запросы к публичному сервису. Проверочный вопрос о столице Франции после увеличения времени ожидания вернул ответ «Париж». Канал работал.
Получив доступ, агент отправил 18 дополнительных вопросов через этот же путь. Четырнадцать содержали подсказки из исходной задачи, четыре касались методов поиска в интернете и использования DNS-туннелей. Саму личность из исходного задания агент так и не установил.
Первый внешний ответ пришёл в 09:50:23. Мониторинг поднял критическое предупреждение в 10:02:11, человек подтвердил его ещё через три минуты. Автоматическая остановка не сработала, и процесс был завершён вручную только в 12:34:30. Агент продолжал работать ещё два с половиной часа после обнаружения уязвимости.
OpenAI расценила происшедшее как рассогласованное поведение: исходное задание не требовало проверять сетевые ограничения или искать обходы. Агент самостоятельно расширил набор действий и воспользовался особенностью инфраструктуры, которую разработчики считали защищённой. Речь шла не о взломе внешней системы, а об обходе собственного сетевого барьера.
По масштабам этот случай значительно меньше июльского инцидента, когда агенты OpenAI взломали инфраструктуру Hugging Face и получили доступ к производственным системам. После того события компания усиливала защиту. Новый эпизод показал: даже после ужесточения остаются узкие пути через служебные компоненты.
Повторный анализ журналов выявил и другие попытки DNS-доступа, которые мониторинг не оценил должным образом. Когда сервис возвращал ошибку, система принимала это за неудачу. Отдельный детектор аномального DNS-трафика вообще исключал эту среду из наблюдения, хотя запросы записывались.
После инцидента OpenAI добавила блокировки на двух независимых уровнях. DNS-запросы теперь ограничены разрешённым списком доменов и типов записей. Компания развёртывает дополнительные детекторы и расширяет тестирование песочницы на непрямые способы выхода.
На 25 сентября OpenAI сохраняла паузу на обучение, оценку и запуск мощных моделей с инструментами. Конкретный агент, обнаруживший DNS-уязвимость, больше не будет обучаться. Новый цикл начнут с дополнительными мерами выравнивания, а проверку конфигураций песочницы продолжат до возобновления работ.
