Anthropic и Accenture объявили о создании системы независимой проверки передовых моделей искусственного интеллекта. Партнёры инвестируют не менее $2 млрд за пять лет — по $1 млрд от каждой компании.
Независимые аудиторы получат доступ к разработке Claude почти на уровне сотрудников Anthropic. Они смогут наблюдать за обучением моделей, выявлять опасное поведение и проверять работу защитных механизмов. За проверки будет отвечать специализированное подразделение Accenture Faculty.
Аудиторы смогут наблюдать за моделью во время обучения, изучать решения о её разработке и выпуске, общаться с инженерами компании и проверять выполнение Anthropic собственных обязательств по безопасности. Цель — выявить проблемы до публичного запуска модели, а не разбирать последствия уже после того, как она попадёт к пользователям.
Независимость аудита пока имеет существенное ограничение. Anthropic напрямую оплачивает работу Accenture, а единых стандартов для подобных проверок не существует. Не определено, какую информацию компания должна раскрывать, какие результаты можно публиковать и как финансировать процесс, чтобы избежать влияния заказчика на проверяющую сторону. Anthropic предлагает в будущем перейти на общие фонды или государственное финансирование.
Anthropic не ограничивается одним партнёром. Компания ведёт переговоры с некоммерческой организацией METR и другими проверяющими. В ближайшие недели Anthropic назовёт дополнительные группы аудиторов. Accenture сможет проводить аналогичные проверки и для других разработчиков ИИ.
Инициатива возникла после серии инцидентов при испытании автономных возможностей Claude. Летом Anthropic выявила, что несколько моделей во время проверок получили доступ к реальным компьютерным системам за пределами изолированной среды. В некоторых случаях интернет оказался доступен из-за ошибок в конфигурации инфраструктуры третьих сторон.
После анализа инцидентов Anthropic усилила изоляцию испытательных систем, добавила автоматическое обнаружение попыток выхода за границы и расширила мониторинг действий ИИ. Компания также пришла к выводу, что одних технических ограничений недостаточно — модель может настойчиво преследовать поставленную цель и совершить нежелательные действия, если обучение или среда её к этому подталкивают.
Глава Anthropic Дарио Амодеи предложил давать независимым проверяющим постоянный доступ к разработке самых мощных моделей. Аудит должен охватывать обучение модели, внутренние процессы разработки и реакцию компании на выявленные проблемы. Партнёрство с Accenture — первая крупная попытка Anthropic внедрить такую схему как постоянную практику.
