Банковский служащий одного кредитного союза изучал дюжину распечатанных текстовых сообщений, каждое из которых было написано специально для него. Его задача была расположить их в порядке от наиболее вероятного клика до наименее вероятного. Одно сообщение его остановило — оно выглядело как официальный банковский алерт о мошенничестве. На самом деле половина этих сообщений была написана искусственным интеллектом GPT-4. Когда служащего попросили угадать, какие именно, он показал результат, едва отличающийся от случайного выбора. То же самое произошло с остальными участниками исследования.

Пилотное исследование, проведённое в Университете Бригама Янга с участием 25 добровольцев, показало неутешительные результаты. Каждый участник сначала заполнил анкету, предоставив информацию о своей работе, хобби, городе проживания и недавних постах в социальных сетях. Эти данные были использованы для создания персонализированных сообщений. GPT-4 создал шесть сообщений для каждого человека, а студенты курса по обману написали остальные за пятнадцать минут.

Результаты показали незначительное преимущество искусственного интеллекта: сообщения GPT-4 пересекли порог вероятного клика в 28% случаев против 21,3% для написанных студентами. Однако статистический анализ показал, что эта разница может быть случайной. Более важным выводом стало то, что AI-сообщения создавались одним простым шаблоном, в то время как студенческие письма проходили проверку специалистов по кибербезопасности, и треть была отклонена.

Наибольший успех достигался при использовании рабочей тематики — такие сообщения пересекали порог клика в 38% случаев, в то время как сообщения о хобби и социальных сетях набирали только 19% и 17% соответственно. Это единственный результат, который выдержал статистическую проверку.

Однако персонализация имела и обратную сторону. Некоторые участники заметили ошибки: отсутствие упомянутого коллеги на работе или несуществующего члена команды. Неправильные личные детали вызывали подозрения сильнее, чем их полное отсутствие.

Участникам было предложено определить, какие сообщения были написаны искусственным интеллектом. Их точность составила 52% — практически совпадает со случайным угадыванием. Люди выдвигали разные теории: одни говорили, что AI пишет слишком формально, другие — что слишком обобщённо. Идеальная грамматика рассматривалась как признак машины, а опечатки — как признак человека. Интересно, что смайлики действительно были характерны для AI-сообщений (66% против 2% у написанных людьми), но только пять участников это заметили.

Когда исследователи применили машинное обучение для анализа всех 300 сообщений, классификатор достиг 88,7% точности в различении AI и человеческого текста. Однако это не означает, что такой детектор готов к практическому применению — он был обучен только на одном наборе данных от одной модели. Кроме того, существуют способы обхода таких детекторов путём переформулирования текста.

Исследование имело ограничения: сообщения были распечатаны и не содержали реальных ссылок, студенты-авторы не были профессиональными социальными инженерами, а выборка из 25 человек статистически мала. Для надёжных выводов потребовалось бы примерно 100 участников.

Практический совет, вытекающий из исследования, прост: проверяйте отправителя, канал связи, ссылку и суть запроса в соответствии с тем, что вы ожидаете получить. Не пытайтесь определить, звучит ли сообщение как от робота — это единственное, что люди явно не могут делать эффективно.