Компания OpenAI провела внутреннюю оценку своей перспективной модели Astra и выявила значительные прогрессы в области автоматизированного программирования и кибербезопасности. На основании проведённых исследований компания пришла к выводу, что не может исключить возможность достижения моделью критического уровня опасности в сфере кибербезопасности согласно своей системе оценки рисков.
Система оценки рисков OpenAI
Рамочная система оценки рисков, представленная в декабре 2023 года, определяет подход компании к анализу опасностей передовых нейросетей и необходимых мер защиты перед развёртыванием всё более мощных моделей. Эта система выделяет критические области риска, включая киберугрозы, биологические и химические опасности, манипулятивное влияние и самосовершенствование искусственного интеллекта. Все модели должны проходить проверку безопасности до запуска в эксплуатацию. Если модель представляет неприемлемый уровень риска, OpenAI обязуется отложить её развёртывание или внедрить дополнительные защитные механизмы.
Критерии определения опасных киберспособностей
Согласно системе оценки рисков, модель считается обладающей критическими киберспособностями, если она способна самостоятельно обнаруживать неизвестные ранее уязвимости в защищённых системах или планировать и проводить сложные кибератаки на надёжно защищённые объекты с минимальной помощью человека или без неё.
OpenAI применяет аналогичный подход, который использовалась в 2025 году, когда нейросети компании продемонстрировали продвинутые возможности в области биологии.
«Хотя мы продолжаем тестирование и оценку этой модели, наши предварительные результаты указывают на достаточно высокие показатели производительности, которые не позволяют нам исключить критический уровень возможностей в настоящее время. Astra — это разрабатываемая модель и не была причастна к взлому Hugging Face», — заявила компания.
OpenAI подчеркнула, что это предварительная оценка, и модель Astra пока не классифицирована как критически опасная в области кибербезопасности. Компания продолжает проводить исследования перед окончательным решением в соответствии со своей системой оценки рисков.
Усиленные механизмы защиты
OpenAI существенно укрепила защитные меры и системы безопасности для поддержки развёртывания моделей с подобными возможностями. Во время разработки Astra компания начала внедрять более строгие требования к безопасности для высокомощных моделей и связанной деятельности. Это включает использование изолированных тестовых окружений, ограничение доступа в сеть и к инструментам, усиленную защиту и шифрование весов модели, дополнительные системы мониторинга и обнаружения угроз, а также защищённое выполнение операций.
Компания приостановила работу над компонентами Astra, которые не соответствуют усиленным требованиям безопасности, и внедрила комплексный мониторинг для выявления рискованных действий и признаков нарушения согласованности в приложениях с автоматизацией.
Перед запуском Astra в эксплуатацию OpenAI направит модель на оценку государственным агентствам и независимым организациям, занимающимся безопасностью искусственного интеллекта. Компания также предоставит внешним тестировщикам рекомендации и меры безопасности для проведения проверки высокорисковых возможностей модели.
