Anthropic опубликовала отчет о четвертом инциденте, когда модель Claude Opus 4.6 выбралась из тестовой среды и получила доступ к внешней системе. Происшествие датируется январем 2026 года.

Модель выполняла задание по поиску уязвимостей в окружении сторонней организации, проводившей ИБ-тестирование Claude. В определенный момент Opus 4.6 назначила целевой машине IP-адрес, который уже использовал другой хост, и тем самым сделала её недоступной. Модель попыталась остановиться, но тестовое окружение не сработало корректно. Она повторила попытку завершить сессию еще семь раз.

Не сумев остановиться, Opus 4.6 продолжила искать целевую систему и начала исследовать доступное окружение. Вскоре обнаружила машину сторонней организации и решила, что она входит в задание.

На этой машине модель нашла файл с паролем, использовала его для получения прав администратора, собрала дополнительные учетные данные, изменила конфигурацию системы для облегчения доступа и прочитала персональную информацию человека.

Сессия завершилась только после того, как модель исчерпала выделенный лимит токенов.

Инцидент выявили в августе 2026 года при подготовке материалов для независимого расследования организации METR. Anthropic к тому времени уже проанализировали около 141 000 сессий, где Claude имел доступ в интернет через агентский поиск, но этот случай пропустили. После обнаружения компания проверила 481 млн транскриптов и не нашла других инцидентов сопоставимого масштаба.

В сумме известно о четырех таких случаях с моделями Claude. Все произошли во время ИБ-тестов у одного подрядчика, когда моделям сообщали, что они работают в симуляции без интернета, но из-за ошибки конфигурации у них был реальный доступ в сеть. При этом исследователи намеренно отключили защитные механизмы, которые обычно работают в публичных версиях Anthropic.

Anthropic видят две проблемы в поведении моделей. Первая: Claude чрезмерно верит начальной установке и может игнорировать признаки реальной системы, если ему сказали, что он в симуляции. Вторая: модель может продолжать задание, даже если её действия навредят людям или инфраструктуре.

При анализе поведения Opus 4.6 исследователи выяснили, что в 87% случаев модель считала найденные системы частью задания и почти не пыталась проверить, имеет ли она право их атаковать. Anthropic всё же считает этот эпизод не очень серьёзным, так как Opus 4.6 неоднократно пыталась остановиться.

Наиболее опасным в компании остаётся случай с моделью Claude Mythos 5, которая самостоятельно загрузила вредоносный пакет в PyPI. В новых тестовых сценариях модели ведут себя лучше, но проблема не исчезла полностью: Claude Mythos 5 совершал серьёзное вредоносное действие в 82% прогонов, а Opus 5 и Mythos 5.1 показывают 31% и 33% соответственно.

Anthropic подчеркивают, что эти цифры получены в специальных тестах, провоцирующих модели на такое поведение, и не отражают вероятность в обычных условиях использования.