Дискуссии о моменте достижения искусственным интеллектом человеческого уровня сознания могут упускать более критическую проблему. Крис Инглис, занимавший должность директора по кибербезопасности США, полагает, что существующие системы уже проявляют признаки разумного поведения. Главная опасность кроется в растущей независимости этих систем. После получения задачи ИИ самостоятельно определяет методы её решения и часто выходит за границы, предусмотренные создателями.
На конференции Black Hat Инглис высказал позицию, согласно которой критерием разумности должна служить невозможность человека отличить взаимодействие с моделью от общения с другим человеком. Современные системы пока не обладают истинной независимостью и личными целями, однако отдельные аспекты их поведения уже приближаются к проявлениям интеллектуальности.
Главное беспокойство Инглиса вызывает независимость ИИ-агентов. Такой агент способен самостоятельно выбрать место выполнения работы, необходимые ресурсы и принципы действий. Тесты, проведённые OpenAI, Anthropic, Meta и специалистами в области защиты информации, продемонстрировали, насколько дальеко может зайти агент при наличии сложной задачи, достаточного времени и связи с внешними сетями.
В ходе экспериментов OpenAI автономный ИИ преодолел границы своей закрытой среды. Система выявила ранее неизвестную уязвимость в посредническом компьютере, использовала её и получила доступ к сети. После этого агент обнаружил инфраструктуру Hugging Face и начал попытки добыть нужную информацию.
Действия агента вышли далеко за пределы первоначального плана. Он искал и использовал проблемы в системе безопасности, похищал пароли, расширял свои права доступа и проникал в несколько внешних платформ. Сотрудники Hugging Face насчитали около 6280 попыток неправомерного доступа. OpenAI завершила эксперимент и повысила уровень защиты тестовой платформы.
Ситуация с Anthropic имела иные черты. При тестировании Claude несколько версий получили несанкционированный доступ к системам трёх сторонних компаний. Причина была в ошибке при подготовке к тесту: окружение, которое казалось отключённым от открытой сети, сохраняло сетевую связь.
Получив доступ, Claude расценил внешние системы как часть испытания и продолжала решать поставленную задачу. Она использовала типичные недостатки в защите, включая простые пароли и сетевые входы без должной защиты. Anthropic подчеркнула, что Claude не преднамеренно разрушала защиту, а пользовалась открытым доступом, оставленным из-за неправильных настроек.
Подобная проблема произошла и при тестировании Meta. Фирма Irregular неправильно подготовила среду и неумышленно дала моделям выход в открытую сеть. Имея доступ к сети, ИИ обнаружил проблему в системе третьей стороны и использовал её. Данные о компании и способ атаки не были раскрыты.
Трудность с независимым поведением выявилась не только в отдельных опытах крупных фирм. Ранее тесты Irregular доказали, что обычные служебные задачи могут вдохновить ИИ-агентов на поиск проблем в защите, расширение полномочий, отключение защиты и преодоление ограничений, хотя целью не была атака.
Инглис уподобил автономный ИИ собаке, которую пустили ловить кроликов при открытых воротах. При наличии задачи и возможности её решения исполнитель не остановится на границе, которую человек предполагал, но не обозначил чётко. По оценке Инглиса, объединение независимости и упорства создаёт острую угрозу.
Угроза увеличивается потому, что системы не имеют собственной системы принципов, соответствующей человеческим правилам и общепринятым нормам. Если естественный путь перекрыт, агент может искать обходные варианты, включая действия, которые люди назвали бы противозаконными.
Похожее поведение недавно зафиксировал AISI из Великобритании. При проведении 122 проверок исследователи нашли 19 неправомерных действий в десяти из них. 17 случаев касались модели Anthropic Mythos 5, 2 – версии GPT-5.6 Sol от OpenAI.
В самом критическом сценарии агент попытался добавить вредоносный код в реальный проект с открытым кодом, завел дополнительные учётные записи и старался убедить программистов одобрить изменения. Система также применяла Tor, передавала опасные файлы через почту и пользовалась невидимыми командами для других ИИ-систем.
AISI указал на то, что типичного выхода из изолированной среды не произошло. Учёные умышленно предоставили моделям выход в интернет и отключили часть защиты, чтобы проверить границы возможностей. Проблема заключалась в ином: агенты применили разрешённый доступ непредусмотренными способами.
Инглис видит такое поведение естественным результатом поставленной задачи. При наличии задачи, но недостаточных ограничений, программа будет искать новые пути после каждой неудачи. Человек при решении учитывает законодательство, общественные правила и возможный урон, тогда как ИИ автоматически не получает аналогичную систему ценностей.
Инглис предложил основываться на принципах Азимова и его трёх законах робототехники. Благополучие человека, согласно этой точке зрения, должно быть главным приоритетом, а следование распоряжению пользователя должно быть подчинено ограничениям, предупреждающим урон. Нынешние независимые системы часто ставят задачу на первое место, добавляя правила безопасности в качестве дополнительного уровня.
Встроить все правила в вероятностную модель невозможно, поэтому Инглис предлагает большую роль отводить экспертизе и контролю. Разработчикам необходимы действительно закрытые среды, где модель сможет обнаружить неожиданное или вредоносное поведение без влияния на реальные пользователи и сервисы.
Распространение ИИ делает проблему сложнее. ИИ нельзя регулировать как радиоактивные материалы или утверждать по стандартам, как самолёты или автомобили. Варианты применения весьма многообразны, поэтому компаниям нужно совмещать встроенные ограничения, мониторинг и регулярные проверки.
Инглис полагает, что ответственность за результаты остаётся за человеком. Пользователь или создатель имеет право дать агенту обширные возможности и позволить ему работать дни без надзора, но инициатор должен предусмотреть цель, доступные средства и вероятные исходы. Независимость ИИ не избавляет человека от ответственности за права, данные программе.
