Половина добровольцев, проведших минутный видеозвонок с системой Griffin-Lite, посчитала, что разговаривала с человеком. Из 54 участников эксперимента 26 человек не распознали подмену. Tavus назвала результат первым успешным прохождением видеоверсии теста Тьюринга в живом общении.
Участников из США и Европы набрали через исследовательскую платформу. Им объяснили, что система соединит их с другим добровольцем для минутного разговора о планах на год. На деле собеседником был Griffin-Lite, который создавал лицо, речь и ответы в реальном времени. О присутствии ИИ никому не сообщали.
После звонка люди описали слова собеседника, оценили естественность беседы, доверие и ощущение, что их слушают. В конце опроса организаторы спросили, приходила ли мысль о том, что собеседник — ИИ. Затем раскрыли подмену.
Те, кто принял Griffin-Lite за человека, были уверены в ответе на 79% в среднем. Распознавшие ИИ оценили свою уверенность в 81%. Большинство участников вообще не думали о возможной подмене, а те, кто заподозрил неладное, обычно приходили к этому в первые 20 секунд.
Tavus протестировала Griffin-Lite против своей предыдущей системы, где разные модели отвечали за изображение, восприятие и управление разговором. Её приняли за человека только один из 41 участника — 2,4%.
Разница в результатах связана с тем, как Griffin-Lite ведёт беседу. Стандартный голосовой ИИ работает поочередно: слушает, распознаёт речь, готовит ответ, затем говорит. Griffin-Lite одновременно смотрит, слушает и генерирует реакцию. Система может кивнуть посередине чужой фразы, выдержать паузу, начать отвечать без пауз или остановиться, если её прервали.
Видео создаётся непрерывно, а не берётся из предзаписанных роликов. Griffin-Lite передаёт видео 720p блоками по 320 миллисекунд. На ускорителях Nvidia H100 задержка между звуком и соответствующей реакцией на экране в среднем 0,43 секунды. Система учитывает направление взгляда, выражение, паузы и движения перед камерой, поэтому ответ зависит не только от распознанных слов.
Способность реагировать на невербальные сигналы проверили в независимом бенчмарке VideoFDB на 237 фрагментах настоящих видеозвонков. Тест оценивает, замечает ли модель паузы, взгляд, мимику и другие сигналы, а также насколько правдоподобно она отвечает голосом и лицом. Griffin-Lite получила 3,73 из 5 за восприятие при человеческом результате 4,20 и 3,83 за собственные реакции при человеческом 3,92.
Но цифра 48% пока не доказывает, что Griffin-Lite невозможно отличить от человека в реальной жизни. Эксперимент провела сама Tavus, выборка была всего из 54 человек, разговор длился одну минуту, а участникам заранее сказали, что их соединят с другим человеком. Остаётся неизвестным, сохранится ли результат при десятиминутном разговоре, обсуждении сложной темы, общении на других языках или когда пользователь с начала старается разоблачить ИИ.
Тест Тьюринга Griffin проходит не первым. Текстовые модели уже убеждали собеседников в своей человечности чаще. Новизна эксперимента Tavus в том, что это видеосвязь, где машина одновременно поддерживает речь, голос, мимику, взгляд и ритм живого общения.
Tavus пока не открыла Griffin-Lite для обычных клиентов и даёт исследовательскую версию только ограниченной группе тестировщиков. Компания признаёт риск: система, которая убедительно изображает человека в видеозвонке, одновременно становится инструментом для обмана. Перед расширением доступа разработчики планируют добавить механизмы, которые явно указывают собеседнику на присутствие ИИ.
