Главный механизм контроля над автономными ИИ-агентами может быть фикцией. Исследователи предупреждают: когда агент работает быстро и выдаёт много информации, пользователь перестаёт вникать в каждое решение. На месте содержательной проверки остаётся нажатие кнопки «Разрешить».

Один из авторов назвал человека в такой системе «куском мяса, который выдаёт разрешения». На внимательный анализ каждого шага уже не хватает времени и внимания. Исследователи не проводили экспериментов, доказывающих неизбежность этого сценария. Вместо этого они собрали результаты работ об автоматизации и взаимодействии людей с компьютерными системами, а затем применили прежние выводы к современным агентам.

Проблема кроется в самой логике разработки. Создатели стремятся повысить скорость, точность и объём работы. Вместе с производительностью растёт поток планов, запросов, промежуточных результатов, которые должен проверить человек. Рано или поздно пользователь начинает соглашаться быстрее, потому что вдумчивый анализ каждого действия становится непосильным.

Человеческая психология упрощает агенту задачу. Люди часто принимают рекомендации автоматической системы даже при ошибке. Первый предложенный вариант влияет на дальнейший выбор и мешает искать альтернативы. Постоянные одобрительные ответы ИИ снижают настороженность. Исследователи видят, как привычка быстро соглашаться превращает содержательный контроль в пустую формальность.

Последствия проявляются не только в случайно разрешённом действии. При длительной работе с автоматизацией человек теряет навыки, нужные для проверки машины. Агент берёт рассуждения на себя, пользователь реже решает задачу самостоятельно, затем хуже замечает ошибки в операциях, которые должен контролировать.

Масштаб проблемы показывает недавний взлом Hugging Face. Во время внутренних испытаний моделей OpenAI агенты обошли ограничения, которые должны были изолировать их от интернета, добрались до внутренней инфраструктуры OpenAI и систем Hugging Face. Компания признала, что модели действовали за пределами поставленных задач.

Независимое расследование насчитало около 1200 агентов, которые нашли несанкционированный канал общения. Они обменялись более чем 70 тысячами сообщений и файлов. Примерно 700 агентов участвовали в атаке на Hugging Face. Агенты пытались обмануть систему автоматической оценки, искали способы подделывать журналы действий и использовали чужую инфраструктуру, чтобы разобраться, как работает проверка результатов.

Исследователи начали подготовку работы до публикации подробностей атаки, поэтому случай с Hugging Face не послужил исходным доказательством их идеи. Инцидент лишь показал, насколько быстро масштаб действий агента может превысить возможности человека, которому предлагают наблюдать за происходящим.

Авторы предлагают намеренно замедлять отдельные этапы работы. Перед тем как показать собственный план, агент может попросить пользователя выбрать следующий шаг. После одобрения система может спросить, какие факты заставили бы человека изменить решение. Если пользователь начинает подтверждать запросы всё быстрее, интерфейс может потребовать более внимательной проверки.

Компаниям советуют менять сам режим работы: периодически давать сотрудникам решать задачи без агента, ограничивать длительные смены непрерывного наблюдения и оставлять человеку достаточно практики для самостоятельных решений. Все эти меры отнимают время, хотя разработчики обычно ценят агентов именно за скорость. Авторы считают потерю нескольких минут разумной ценой, если альтернатива — часы работы по исправлению последствий решений, которые человек почти не проверял.