Люди эволюционно приспособлены общаться лицом к лицу: мы используем не только слова, но и интонацию, мимику, жесты и паузы — большая часть человеческой коммуникации невербальна. До сих пор машины этого не понимали и требовали, чтобы мы подстраивались под них, учили их язык — нужную команду, нужный клик, нужный промпт. Стартап Tavus считает, что должно быть наоборот.
HIM — это новый класс моделей ИИ, предназначенных для понимания и генерации человеческого взаимодействия лицом к лицу в реальном времени. Они слушают собеседника и обращают внимание на выражения лица и паузы, а не только на слова. Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. Плюс отлично следует инструкциям, и видит/понимает собеседника и его окружение (например, может помочь собрать кубик рубика). Griffin объединяет прежние исследования Tavus в области восприятия в реальном времени, разговорной речи и выразительного человекоподобного видео в единую систему video-to-video.
Это первая модель, прошедшая видео-тест Тьюринга в реальном времени: в живом исследовании 48% участников, поговоривших с Griffin, решили, что общались с живым человеком, тогда как прежние системы, включая собственный разговорный видеоинтерфейс Tavus (на базе Phoenix 4.5, Sparrow-2 и Raven-1), давали максимум 2% положительных результатов. Это огромный прорыв в понимании человека машиной. Стартап объясняет его инновационным дуплексным подходом с аудиовизуальной генерацией в режиме реального времени.
Griffin генерирует каждый пиксель в каждом кадре в режиме реального времени, используя всего одно исходное изображение. Система управляет всей сценой целиком: не только лицом, руками и пальцами, но и такими элементами, как движение кресла, в котором сидит человек, отбрасываемые им тени и фон позади него. Каждые доли секунды она решает, стоит ли сейчас молчать, кивнуть, поддакнуть или перебить собеседника, и все это время продолжает смотреть и слушать, в том числе пока говорит сама.
Пока модель доступна только избранным тестировщикам, потому что Tavus действительно уверены, что она способна обмануть человека, заставив его думать, что он говорит не с ИИ; релиз обещают «очень скоро» после проработки безопасности и разработки водяных знаков.
В 1950 году Алан Тьюринг задал вопрос: «Может ли машина мыслить?» — и предложил тест, который должен был дать на него ответ. Почти 75 лет спустя профессор информатики Питер Деннинг в новой книге «Ошибка Тьюринга: как выбраться из-под ига неразумных машин» утверждает, что две ключевые посылки Тьюринга завели исследования ИИ в тупик и стали причиной нынешнего кризиса доверия к искусственному интеллекту.

