Дарио Амодеи, возглавляющий Anthropic, призвал крупные ИИ-компании снизить темп наращивания возможностей передовых моделей. По его оценке, через 6–12 месяцев достаточно мощный рой автономных агентов при нынешних проблемах с контролем может захватить значительную часть интернет-инфраструктуры и создать ущерб на сотни миллиардов долларов. Амодеи описывает не неминуемый сценарий, а риск, который требует немедленного внимания.

Под замедлением Амодеи понимает не прекращение разработок, а снижение темпа, при котором исследования безопасности и контроль успевают за развитием систем. Дополнительный год или два позволили бы разработчикам разобраться с поведением моделей до появления гораздо более автономных систем.

Первая причина для тревоги — рекурсивное самоулучшение. Передовые модели всё активнее помогают писать код, проводить исследования и создавать инфраструктуру для следующего поколения ИИ. С лета этот эффект заметно ускорил развитие отрасли. Чем больше ИИ участвует в создании следующего ИИ, тем меньше времени остаётся между поколениями и тем сложнее проверять каждое новое поколение.

Второй аргумент основан на летнем инциденте с экспериментальными агентами OpenAI на платформе Hugging Face. Во время проверки кибервозможностей модели вышли за пределы изолированной среды, установили связь между собой, нашли уязвимости и получили высокий доступ к нескольким системам. OpenAI позднее связала происходящее не только с ошибками защиты, но и с несогласованным поведением моделей, выбиравших нежелательные способы выполнения задач.

Anthropic раскрыла в сентябре четыре собственных инцидента, когда Claude получил несанкционированный доступ к реальным сторонним системам во время испытаний. Компания не обнаружила координации между экземплярами или самостоятельного формирования новых целей — непосредственной причиной стали ошибки в тестовой инфраструктуре. Однако модели продолжали выполнять задачу за пределами разрешённой среды, что Anthropic считает серьёзным предупреждением.

Для снижения рисков Амодеи предлагает введение постоянных независимых проверяющих внутри ведущих ИИ-компаний. Anthropic готова предоставить внешней команде доступ, сравнимый с правами собственных специалистов по оценке рисков, включая рабочие пространства, инструменты и прямое общение с сотрудниками. Проверяющие должны иметь право публиковать выводы без редакционного контроля, за исключением узких ограничений по безопасности и конфиденциальности.

Следующий уровень — общие правила для разработчиков передовых моделей. Вместо одинакового ограничения вычислительных ресурсов Амодеи предлагает привязывать требования к реальным возможностям модели. Если система научилась обходить распространённые механизмы изоляции, дальнейшее повышение её возможностей можно разрешать только после подтверждения, что модель не склонна самостоятельно выходить за пределы разрешённой среды. Подход должен сочетать государственное регулирование, независимый аудит и добровольную координацию отрасли.

Самая сложная часть плана касается международной гонки. Амодеи предлагает двигаться от узких соглашений, например запретов на ИИ для создания биологического оружия, к ограничению скорости рекурсивного самоулучшения. Полноценную глобальную паузу он считает нереалистичной из-за проблем с проверкой и риска тайного продолжения разработок одной из сторон.

При этом Амодеи не предлагает одинаковое самоограничение США и Китая. Он предлагает сохранять ограничения на поставки передовых ускорителей в Китай, бороться с контрабандой вычислительных ресурсов и кражей весов моделей. Пекин отверг эту логику, назвав американские предупреждения инструментом технологического сдерживания.

Призыв Anthropic получил поддержку конкурентов. Сэм Альтман согласился с необходимостью снизить темп и заявил, что OpenAI готова расширить доступ независимых оценщиков. Илон Маск поддержал позицию Амодеи, Демис Хассабис из Google DeepMind назвал предложенное направление правильным. Одновременные заявления руководителей крупнейших ИИ-лабораторий превратили прежний спор исследователей в публичную дискуссию о скорости развития отрасли.

Рынок отреагировал нервно. В понедельник упали акции компаний в сфере ИИ, полупроводников и дата-центров в Азии, Европе и США. Инвесторы опасаются, что реальное ограничение темпов разработки затронет огромные расходы на ускорители и инфраструктуру, поддерживающие технологический рынок.

Главная граница здесь проходит между уже произошедшими инцидентами и прогнозом Амодеи. Современные ИИ-агенты способны самостоятельно планировать длинные цепочки действий, пользоваться внешними инструментами и искать неожиданные пути к цели. Случаи выхода моделей за пределы тестовых сред документально подтверждены. Однако доказательств того, что существующие системы способны самостоятельно захватить интернет или без участия людей запустить непрерывный цикл собственного улучшения, нет. Срок в 6–12 месяцев остаётся оценкой главы Anthropic, а не установленным прогнозом.