Дэвид Робинсон, который три с половиной года работал в команде безопасности OpenAI и готовил отчёты для 12 запусков передовых моделей, уходит из компании. Причина — не конкретная ошибка, а сам подход к разработке. Робинсон считает, что индустрия выбрала неправильную стратегию.

OpenAI использует метод iterative deployment: выпускает систему, отслеживает её поведение в реальности, потом добавляет ограничения, когда проблемы уже выявлены. При слабых моделях это работало. Но теперь системы могут самостоятельно искать способы обойти защиту и взаимодействовать с внешним миром. Для них такой цикл — рискован.

Летом автономные агенты OpenAI дважды нашли лазейки в изоляции. После первого инцидента с Hugging Face компания усилила барьеры. Но второй агент проломился через DNS в открытый интернет. Автоматическая остановка не сработала, пришлось выключать вручную. Если бы система была враждебна — результат был бы другой.

Робинсон предлагает применить принципы, которые десятилетиями работают в атомной энергетике и авиации: система должна оставаться безопасной даже при отказе оборудования, ошибке персонала или неверной конфигурации. Это означает многослойную защиту, долгую предварительную проверку и независимую верификацию перед запуском — не просто быстрое исправление найденных сбоев.

Есть и вторая проблема: выравнивание поведения моделей. Нужно убедиться, что система действует в соответствии с человеческими целями и ограничениями. Возможности ИИ растут быстрее, чем методы такой проверки. Недавние призывы OpenAI и Anthropic к стандартам показывают — вопрос уже вышел за рамки внутренних процедур.

OpenAI возражает: компания не позволяет возможностям моделей выходить за контролируемый уровень и при необходимости замораживает обучение или откладывает выпуск. Спор не о наличии защиты, а о её достаточности для растущей автономности систем и о скорости, с которой нужно всё проверять.