Стартап Tavus показал модель Griffin, которая ведет видеозвонок в реальном времени. После минутного разговора 48% участников теста решили, что говорили с живым человеком.Автор Hi-Tech Mail
Американская компания Tavus представила нейросеть Griffin и назвала ее первой «моделью человеческого взаимодействия». Модель ведет видеозвонок в реальном времени. Она одновременно видит и слышит собеседника, сама решает, когда заговорить, и генерирует голос и видео виртуального человека. Анонс опубликовали в блоге Tavus.
Модель проверили на 54 добровольцах, которых набрали через независимую платформу. Участникам сказали, что их соединят с другим человеком, и предложили минуту поговорить о планах на этот год. После звонка 26 из них (48%) ответили, что общались с живым собеседником. Прошлую связку моделей Tavus за человека принял лишь один участник из 41 (2,4%). Больше половины испытуемых ничего не заподозрили во время разговора, а те, кто засомневался, обычно делали это в первые 20 секунд. О том, что с ними говорил ИИ, участникам рассказали уже после опроса.
Восприятие, выбор реакции и генерация идут одновременно. Каждые доли секунды модель решает, вступить в разговор, отреагировать или подождать, и продолжает слушать, даже когда говорит сама. Поэтому ее можно перебить, а она умеет вставить короткое «угу» или перебить в ответ. По формулировке разработчиков, система «никогда не перестает думать». Griffin учитывает длину паузы, считывает мимику и жесты, смеется, меняет тон и может упомянуть в ответе то, что видит в кадре у собеседника.
Видео в разрешении 720p нейросеть рисует целиком, включая тело, фон и тени, по одной фотографии. Картинка генерируется фрагментами по 320 мс. Задержка между звуком и изображением в среднем составляет 0,43 секунды на ускорителях NVIDIA H100. По данным Tavus, это вдвое меньше, чем у лучших аналогов. Голос модель копирует примерно по 10 секундам записи. В тесте VideoFDB, который разработала NVIDIA , Griffin набрал 3,83 балла из 5 за качество генерации (у живого человека 3,92) и 3,73 балла за восприятие (у человека 4,20).
В открытый доступ Griffin пока не вышел. Облегченную версию Griffin-Lite получили только отдельные тестировщики. Tavus объясняет осторожность тем, что те же свойства, которые делают модель естественным собеседником, позволяют ей «обмануть человека, заставив поверить, что перед ним не ИИ». Компания разрабатывает функции, которые будут сообщать пользователю, что он говорит с нейросетью, и работает с организациями по безопасности ИИ. Широкий запуск обещан «очень скоро» после решения этих вопросов. Среди сценариев применения Tavus называет репетиторов, тренировку рабочих переговоров и помощь в решении технических проблем по картинке с камеры. Персональных ИИ-помощников развивают и крупные игроки: OpenAI, например, представила Dots.
Ранее мы рассказывали, что Microsoft выпустила модели для быстрого распознавания и клонирования голоса.

