AI-аватар Griffin от Tavus провёл минутный видеозвонок. После него 26 из 54 участников решили, что на экране был живой человек. Это 48%. Предыдущая версия той же компании набрала 2,4%.

С результатом есть важные оговорки. Исследование проводила сама Tavus, выборка маленькая, а участникам заранее сказали, что они общаются с человеком. Строгим тестом Тьюринга это считать нельзя. При этом разница между 2,4% и 48% выглядит заметно.

Что Griffin меняет в AI-аватарах

Большинство цифровых людей хорошо работают по сценарию. Вы даёте текст, система синхронизирует губы, мимику и голос. Для рекламного ролика или обучающего видео этого обычно хватает.

Griffin заточен под живой разговор. Он отслеживает выражение лица, понимает жесты, ждёт окончания мысли и может отреагировать ещё до полной паузы.

В демонстрациях Vanessa помогает человеку собирать кубик Рубика. Она подсказывает следующий поворот и молчит, пока собеседник думает. В другом тесте модель сопровождает пайку платы, следит за прогрессом и сама предлагает следующий шаг. Ещё Griffin играет в «Simon Says» и реагирует на перебивания во время совместного рассказа.

Для цифрового человека важнее всего то, насколько уместно он ведёт себя в разговоре. Внешность здесь уже не единственная мерка.

Как Griffin работает в реальном времени

Обычная схема похожа на эстафету: распознать речь, передать текст языковой модели, синтезировать ответ, затем оживить лицо. Каждый этап добавляет задержку. По дороге теряются интонация, выражение лица и предметы в кадре.

Griffin обрабатывает аудио и видео вместе. Система переоценивает состояние диалога меньше раза в секунду и выбирает реакцию: говорить, кивнуть, показать эмоцию или продолжить слушать.

Tavus заявляет о среднем отклике 0,43 секунды и генерации видео в 720p блоками по 320 миллисекунд. Griffin умеет клонировать голос примерно по десятисекундной записи. Для звука используется собственный кодек Tavec.

Видео создаётся покадрово, без заранее просчитанного ролика. Поэтому в кадре могут двигаться лицо, губы, руки, фон, тени и предметы вокруг персонажа. По ощущениям это уже ближе к интерактивной сцене, чем к говорящей голове.