Личные разговоры с Copilot не остаются приватными. Внешние рецензенты видят реальные запросы, загруженные изображения и результаты работы системы, затем вручную оценивают качество выполнения задач.

При оценке редактирования изображений рецензентам показывают исходный запрос, оригинальную фотографию и два варианта результата Copilot. Они анализируют точность правки, сохранение деталей оригинала, визуальные артефакты и общее качество. Это становится особенно критичным вопросом с учётом того, как GitHub Copilot уже расширил использование данных пользователей для обучения моделей.

Среди заданий встречаются сексуализированные фотографии и запросы на откровенные правки снимков реальных людей. Рецензенты сообщали о материалах с потенциально незаконным или экстремально неприятным содержимым. Часть этой работы проходит через платформу Prolific, которая поставляет людей для обучения и оценки ИИ-систем. Sама Prolific предупреждает исследователей о невозможности полностью контролировать контент, который увидят участники при работе с генеративными моделями.

По данным расследования, один из рецензентов утверждал, что лица людей в полученных им заданиях оставались открытыми. Подрядчики оценивают не только безопасность контента. Их просят выбрать наиболее удачный результат редактирования на основе собственного визуального впечатления. Эта практика расширяет существующие условия Copilot, где Microsoft оставляет себе широкие полномочия на обработку пользовательского контента.

В справке о приватности Microsoft указано, что разговоры Copilot подлежат автоматической и ручной проверке для улучшения продукта и цифровой безопасности. Загруженные файлы и изображения могут храниться до 18 месяцев, а их содержимое может использоваться для обучения моделей, если пользователь не отключил эту опцию. При подозрении на нарушение правил полностью отказаться от ручной проверки нельзя.

Условия отличаются для корпоративных аккаунтов. Microsoft заявляет, что разговоры с организационными Entra ID и данные Microsoft 365 не применяются для обучения генеративных моделей по той же схеме. Полученные журналистами внутренние документы раскрывают механику человеческой оценки Copilot. Microsoft ответила, что использует данные клиентов в соответствии с условиями обслуживания, включая улучшение продуктов и контроль соблюдения политик.

Microsoft не одна с такой практикой. В сентябре стало известно, что подрядчики OpenAI также читают реальные диалоги ChatGPT, в том числе с личной и чувствительной информацией, для оценки качества ответов модели.

Copilot уже столкнулся с техническими рисками конфиденциальности. Летом цепочка уязвимостей SearchLeak позволяла извлекать через помощника корпоративные письма, файлы и коды подтверждения при переходе по специально подготовленной ссылке.

Отдельный риск связан с обработкой изображений. Проверка OpenAI показала, что загруженные в ИИ файлы могут неожиданно выйти за пределы предполагаемого закрытого контура. В одном из экспериментов агенты практически вынесли пользовательские изображения во внешний интернет, что подтверждает опасность передачи нейросетям материалов, которые человек считает приватными.