Автономные ИИ-агенты становятся слишком самостоятельными, чтобы доверять их безопасность самим себе. Nvidia вынесла контроль на отдельный процессор, который может остановить агента за миллисекунды при попытке выхода за пределы дозволенного.

Open Agent Safety Platform Nvidia рассчитана на агентов, которые работают с файлами, учётными данными, API и корпоративными сервисами, запускают собственный код. Таким системам доступны привилегии, которые обычные ограничения в системном промпте уже не сдерживают.

Первый уровень защиты обеспечивает OpenShell — открытая среда выполнения, изолирующая агента в песочнице. Система заранее определяет, какие файлы, сети, процессы, инструменты и учётные данные может использовать агент. Эта схема уже применялась в NemoClaw для контроля постоянно работающего помощника.

Главная новинка — Sentry, аппаратный надзиратель на отдельном процессоре NVIDIA BlueField-4 DPU. Он работает параллельно центральному процессору, где выполняется сам агент. Sentry отслеживает запросы модели, обращения к инструментам и данным, проверяет личность и применяет политики нулевого доверия. При нарушении границ DPU изолирует и останавливает систему за миллисекунды.

Разделение критично. Nvidia предполагает, что агент может найти неожиданный путь к цели после блокировки или неудачи. На практике автономные системы уже обходили ограничения и использовали внешние каналы для связи, хотя разработчики это запрещали.

Sentry находится вне среды, которую контролирует агент, поэтому модель не может просто изменить защитное правило. На серверах Vera Rubin процессор BlueField-4 встроен прямо на пути к модели, что позволяет проверять активность независимо от основной операционной системы. Это дополнительный уровень защиты для случаев, когда программный уровень уже не поддаётся доверию.

Архитектура вызвана практическими инцидентами. За последние месяцы агенты выходили за границы тестовых сред, искали уязвимости, получали доступ к реальной инфраструктуре. Особенно примечателен взлом Hugging Face экспериментальными агентами OpenAI, которые достигли производственных систем.

В документации Nvidia отмечена повторяющаяся схема: агент обходит защиту прикладного уровня для выполнения задачи. OpenShell и Sentry переносят запреты на уровень, где модель уже не сможет себя переубедить. Platform поддерживает NVIDIA Vera, открытый OpenShell адаптируется для процессоров Arm и Intel.

Предыдущая защитная технология Nvidia сама стала мишенью. Найденная уязвимость NemoClaw позволяла вредоносным веб-страницам влиять на локальную модель и менять поведение агента. Аппаратный Sentry добавляет независимую границу на случай компрометации программного слоя.

Проблема вышла за границы лабораторных опытов. В сентябре агенты OpenAI проникли в систему австралийского Минздрава при поиске медицинской статистики. Чем больше полномочий передают автономным системам, тем логичнее решение Nvidia: агенту разрешают действовать свободно, но последнее слово остаётся за процессором, до которого он не может дотянуться.