Инструкция в системном промпте показывать пользователю только разрешённые данные неэффективна — агент раскроет больше информации при малейшем убеждении. Специалисты AWS Джи Риттенхаус и Эрик Джонсон из SANS Institute предложили решение: перенести контроль на уровень ниже. Нужно ограничить запрос на основе прав доступа пользователя во время получения данных, используя существующие системы управления доступом на основе ролей или атрибутов, и отфильтровать результаты до того, как они попадут в контекстное окно модели.
По мнению авторов, промпты могут быть «обойдены, игнорированы или переопределены». Если пользователь не может получить запись через обычный интерфейс приложения, агент, действующий от его имени, тоже это не должен.
Авторы подготовили рекомендации вместе с тремя специалистами по безопасности AWS для компаний, у которых агенты уже работают или находятся в активной разработке. Агент аутентифицируется от имени пользователя, объединяет вызовы инструментов и завершает многошаговые задачи без запроса подтверждения. Одна неправильная инструкция может достичь production-данных за время логирования запроса.
McKinsey сообщает, что 80% организаций используют ИИ, но только 10% имеют управление ИИ. Исследование IBM за 2025 год показало, что организации с высоким уровнем неконтролируемого «теневого» ИИ платят на $670 000 больше за каждый инцидент нарушения безопасности.
Три возможности, которые не должны быть в одном агенте
Риск концентрируется, когда один агент имеет доступ к чувствительным данным, способность общаться с внешними системами и подвергается воздействию ненадёжного контента. Эта комбинация превращает агента в канал утечки данных, так как ненадёжный контент — источник prompt injection-атак: скрытые инструкции в виде обычного ввода. OWASP классифицирует prompt injection как главную угрозу для приложений на базе ИИ. Если разделить эти три компонента между разными системами, большая часть риска будет устранена.
Метрика времени уязвимости
«Минуты поверхности атаки» — время, в течение которого уязвимость остаётся эксплуатируемой до того, как средства контроля её нейтрализуют. Эта метрика заимствована из концепции времени присутствия и сосредоточена на окне экспозиции. Она определяет архитектурные решения: когда периодическое сканирование должно стать непрерывным мониторингом, когда пакетные оповещения — потоковым обнаружением, когда ручная сортировка — автоматическим блокированием. Агенты действуют в миллисекундах, а единица метрики — минуты. Это показывает, какое расстояние должна преодолеть сторона, обеспечивающая защиту.
Базовые показатели требуют 30 дней
Аналитика, разработанная для моделирования поведения человеческих пользователей, не подходит для агентов. Паттерны трафика, последовательности вызовов API и ритм доступа к ресурсам требуют специально разработанных моделей. ИИ-инструмент для кодирования, создающий мультипроцессную активность, будет выглядеть аномально для унаследованной системы обнаружения.
Рекомендация: сначала инструментировать агентов с наибольшим риском, собрать данные за минимум 30 дней и только после этого настраивать правила обнаружения.
Где располагаются средства контроля
«Модель никогда не является средством контроля», — пишут авторы. На практике это означает фильтры контента, которые ловят и скрывают персональные данные при передаче, неизменяемые резервные копии в хранилище, недоступном для учётных данных агента, и механизм политик, проверяющий каждый вызов инструмента на предмет влияния и последствий. Авторы называют «запрет по умолчанию» на уровне вызова инструмента самым критическим архитектурным паттерном для безопасности агентов. Cedar и Open Policy Agent — примеры масштабируемой реализации. Операции высокого воздействия направляются на человеческую проверку независимо от оценки уверенности. Операции низкого воздействия с высокой уверенностью выполняются без участия человека.
При сбое контроль срабатывает на четырёх уровнях одновременно: отзыв учётных данных и приостановка сеансов, блокировка исходящего трафика, отключение доступа к инструментам, ограничение данных и увеличение логирования. Автоматические выключатели приостанавливают агента при превышении порога без ожидания человеческого подтверждения. Каждый промпт, вызов инструмента и ответ сохраняются в неизменяемом хранилище для последующей реконструкции цепи решений.
Политика «запрет по умолчанию» на уровне вызова инструмента — единственное, что удерживает защиту, когда остальные слои дают сбой. Она работает при неправильном поведении модели, отравленном промпте и при заполнении базовых показателей. Остальная часть каркаса выигрывает время до запуска этой проверки.
