Сектор искусственного интеллекта планирует внедрить один из ключевых подходов из области традиционной информационной безопасности: информирование об обнаруженных атаках и опасных проявлениях систем ИИ. Если одна организация выявит угрозу или нештатное поведение нейросети, другие участники рынка должны быть уведомлены об этом как можно раньше. Члены альянса Open Secure AI Alliance разработали для этого новый механизм под названием Shared AI Findings Exchange (SAFE).

На текущем этапе SAFE еще не является утвержденным стандартом. Linux Foundation опубликовала начальную версию SAFE как открытый запрос на комментарии (Request for Comments) и приглашает специалистов отрасли к обсуждению и совершенствованию регламента. Разработку ведет коллектив Open Secure AI Alliance, в состав которого входят организации NVIDIA, Cisco, CrowdStrike, Hugging Face, Red Hat и множество других. Альянс уже насчитывает более 120 участников со всего мира.

Инициаторы SAFE предусматривают конфиденциальное накопление информации об происшествиях в сфере ИИ, в том числе и о предотвращенных опасных сценариях. Члены сообщества смогут проводить анализ таких событий, информировать заинтересованные компании, обнаруживать закономерности в нарушениях защиты и разрабатывать универсальные стратегии укрепления безопасности. Благодаря этому проблемы или инновационные методы атак, выявленные в одной системе, смогут помочь защитить другие ИИ-решения.

Такой инструмент становится особенно необходимым в контексте развития автономных ИИ-систем. Современная автономная система включает в себя не только нейросетевые компоненты, но и получает возможность взаимодействия с приложениями, документами, профилями пользователей, веб-сервисами и корпоративным ПО. Несовершенство в управлении доступом, уязвимость к манипуляции подсказками (prompt injection) либо неправильная реализация функционала может повлечь не просто некорректный ответ, а реальные изменения в инфраструктуре компании.

Open Secure AI Alliance параллельно разрабатывает публичный набор инструментов для обеспечения безопасности таких систем. NVIDIA выложила в открытый доступ платформу OpenShell для ограничения прав доступа агентов, исследовательский сервис NOOA для проверки и аналитики деятельности агентов, а также утилиту Garak для выявления проблем с защитой данных, манипуляцией подсказками и обходом защитных механизмов. Microsoft, Cisco, Cloudflare, Visa, Palo Alto Networks и иные участники сообщества также предоставляют собственные решения.

SAFE представляет попытку создать для безопасности ИИ систему коллективного накопления опыта. Вместо того чтобы каждая организация независимо изучала идентичные инциденты и попытки взлома, участники системы смогут превращать реальные происшествия в общепринятые методы защиты и тестовые сценарии. Результативность такого взаимодействия будет обусловлена окончательной версией требований SAFE и готовностью отраслевых игроков разделяться деликатной информацией о недостатках в собственных ИИ-системах.