OpenAI остановила крупную операцию по извлечению защищённых рассуждений из своих ИИ-моделей. Организаторов действий компания связывает с людьми, причастными к разработке Kimi — чат-бота китайской компании Moonshot AI.

Кампания началась 1 июля 2026 года. К 24–25 июля активность резко возросла: за два дня зафиксировано более 16 000 запросов от 4000 пользователей с характерным паттерном извлечения данных. Дальнейший анализ выявил аналогичную активность от 15 000 аккаунтов. OpenAI полностью заблокировала операцию 28 июля.

Атакующие не взламывали системы OpenAI. Вместо этого они взаимодействовали с моделями особым образом, заставляя их выводить внутренние рассуждения в форме, доступной пользователям. OpenAI называет такой метод враждебной дистилляцией.

Цель операции — собрать ответы и рассуждения мощных моделей для последующего обучения или улучшения других языковых моделей. OpenAI не раскрыла, какие именно модели подвергались атаке.

В ответ инженеры OpenAI заблокировали участвующие в кампании аккаунты, ужесточили регистрацию и проверки инфраструктуры, расширили мониторинг. Компания также закрыла возможность повторного использования зашифрованных блоков с внутренними рассуждениями в других сеансах или диалогах.

Проблема коррелирует с исследованием августа 2026 года, где специалисты MATS Research, Института ELLIS в Тюбингене и Snyk показали, что зашифрованные блоки рассуждений можно переиспользовать в других сеансах, от других аккаунтов и даже с другими моделями того же поставщика. При передаче такого блока менее защищённой модели её можно вынудить расшифровать содержимое и выдать его открытым текстом.

Исследователи предупреждали, что такой способ позволяет масштабировать атаки на защиту, извлекать приватные данные и скрывать инъекции промптов в зашифрованные блоки.

OpenAI считает, что массовая дистилляция несёт не только коммерческие риски, но и угрозу безопасности: похищенные рассуждения обучают другие модели без сопоставимых мер защиты оригинальной системы.

Это не первое обвинение в адрес Moonshot AI. В сентябре 2026 года Anthropic заявила, что модель Kimi без ведома пользователей отправляла часть запросов в Claude, получала ответы и выдавала их как собственные. Некоторые из этих диалогов Moonshot AI сохраняла и использовала для обучения собственной модели с цепочками рассуждений.