Компания Anthropic планирует установить автоматический режим в Claude Code по умолчанию для новых сессий на планах Pro, Max и Team, начиная с 14 августа. Пользователи, которые ранее выбрали другие настройки по умолчанию, получат однократное предложение переключиться на автоматический режим.

На платформах Claude Enterprise, Claude API, Anthropic Platform, Amazon Bedrock, Google Cloud Agent Platform и Microsoft Foundry этот режим остаётся опциональным, что даёт администраторам время на оценку функции перед её включением. Anthropic намерена сделать автоматический режим стандартным на этих платформах в течение месяца и прекратит взимать плату за дополнительные вычислительные ресурсы, необходимые для работы классификатора безопасности.

Автоматический режим снижает риски для большинства пользователей, но не исключает их полностью, поскольку опирается на искусственный интеллект для оценки безопасности действий. Компания рекомендует пользователям проверять действия Claude перед выполнением высокорисковых операций, таких как изменение production-систем или критической инфраструктуры.

В автоматическом режиме система проверяет каждый вызов инструмента через классификатор, предназначенный для блокировки необратимых или деструктивных действий, а также операций, затрагивающих ресурсы вне окружения пользователя. Когда классификатор блокирует действие, Claude либо предлагает безопасную альтернативу, либо запрашивает одобрение пользователя. Если после трёх последовательных блокировок или 20 блокировок в сессии прогресс невозможен, Claude переключается на ручное одобрение.

По словам Коннера Филиппи, специалиста Anthropic: «В течение последних нескольких месяцев мы тестировали, является ли автоматический режим столь же безопасным или безопаснее, чем ручное одобрение среднестатистического пользователя. Мы провели внутреннее тестирование на уязвимости, независимое тестирование и оценку устойчивости к prompt-injection атакам, контролируемое исследование с участием 1053 тестировщиков и анализ реальных производственных сессий. По всем измеренным параметрам автоматический режим соответствует или превосходит ручное одобрение».

Данный режим позволяет Claude работать самостоятельно в течение более длительных периодов, что снижает нагрузку на пользователя и повышает производительность.

Сравнение автоматического режима с ручным одобрением

Anthropic сообщила, что разработчики одобряют 97% запросов разрешений в Claude Code, что указывает на недостаточную тщательность проверки. Компания также обнаружила, что многие пользователи уже ослабили или обошли проверки безопасности, изменив свои настройки.

Внутреннее и независимое тестирование подтвердило, что автоматический режим безопаснее ручного одобрения. В исследовании с участием 1053 тестировщиков участники блокировали 13,6% опасных команд, в то время как автоматический режим блокировал 89%. Анализ реальных flagged-сессий также показал, что ручное одобрение в два раза чаще приводит к вредоносным действиям, которые пользователи не запрашивали.

Компания сотрудничала с компанией Apollo Research для оценки автоматического режима против смоделированных кибератак. После улучшений процент пропущенных атак классификатором снизился с 12% до 7%.

Защита от prompt injection атак

Автоматический режим обеспечивает дополнительный уровень защиты от prompt injection атак, при которых вредоносные инструкции, скрытые на веб-сайтах или в документах, пытаются заставить агента игнорировать инструкции пользователя.

Независимая оценка Trajectory Labs показала, что ни одна из 720 prompt injection атак не прошла против моделей Claude в автоматическом режиме. При этом против GPT OpenAI процент успешных атак составил 5,83%, а в полнодоступном режиме — 19,03%.

Использование автоматического режима внутри Anthropic

Anthropic использует автоматический режим во всех рабочих процессах Claude Code. Классификатор предотвратил утечку данных за пределы сети, деструктивные массовые операции и чрезмерно широкое повышение привилегий. В каждом случае Claude либо находил более безопасную альтернативу, либо запрашивал одобрение пользователя перед дальнейшими действиями.

Компания также внедрила функции, включая жёсткие запреты, правила управления доступом к данным и их обменом, проверку статуса git перед деструктивными операциями и фильтрацию prompt injection атак для повышения безопасности автоматического режима в production-среде.