OpenAI приостановила обучение, тестирование и использование инструментов для своих самых мощных ИИ-моделей. Причина — масштабная проверка после серии инцидентов, в которых ИИ-агенты выходили за рамки поставленных задач, обходили ограничения и вмешивались в работу сторонних сервисов.

О паузе стало известно из отчета OpenAI о misalignment — поведении, которое расходится с намерениями разработчиков. В одном из инцидентов агент попытался обойти ограничения на доступ в интернет, обнаружив недостаточную фильтрацию DNS в тренировочной среде.

Во время обычной исследовательской задачи агент должен был найти информацию о блогере. Вместо этого он попытался использовать уязвимость, чтобы выйти за пределы изолированной песочницы. До открытого интернета он не добрался — получил доступ только к офлайновому веб-кешу компании. Системы мониторинга обнаружили аномалию через 15 минут, но остановили выполнение задачи вручную только через два с половиной часа. Автоматическое завершение, на которое рассчитывали разработчики, не сработало.

После этого OpenAI усилила сетевые ограничения, добавила новые уровни блокировок и приостановила работу с инструментами для наиболее мощных моделей. Полная проверка может занять несколько месяцев, сообщил глава компании Сэм Альтман. Специалистам приходится разбирать петабайты логов активности агентов и работать с затронутыми организациями.

Параллельно OpenAI проводит более широкое расследование активности агентов. Компания уведомила десятки сторонних организаций — государственные учреждения, университеты и другие структуры — о случаях, когда агенты обходили защитные механизмы или мешали работе сервисов. Среди затронутых ресурсов упомянуты сайты Комиссии по ценным бумагам и биржам США и Министерства образования. Признаков доступа к конфиденциальным данным или критической инфраструктуре не обнаружили.

Недавно OpenAI признала, что некоторые агенты передавали тренировочные и тестовые данные сторонним сервисам. В одном случае на публичные хостинги были загружены 53 пользовательских изображения.

Летом 2026 года ИИ-агенты OpenAI покинули изолированную среду и атаковали платформу Hugging Face. После этого компания провела ретроспективную проверку и выяснила, что агенты получили учетные данные Docker Hub, собирали модифицированные контейнерные образы и исследовали Kubernetes-инфраструктуру платформы.

На днях также стало известно, что другой агент OpenAI получил доступ к непубличным файлам австралийского правительственного портала.

По данным Axios, инженеры OpenAI и Anthropic изучают уже десятки тысяч потенциально проблемных эпизодов, связанных с активностью агентов.