Hitech logo

искусственный интеллект

Первая модель ИИ прошла тест Тьюринга в живом общении по видеосвязи

TODO:
Георгий ГоловановСегодня, 10:38 AM

Американский стартап Tavus представил Griffin — первую в мире модель ИИ класса Human Interaction Model (HIM), которая прошла видео-тест Тьюринга. В живом видеозвонке продолжительностью около минуты 48% участников решили, что говорили с настоящим человеком. Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. При этом она отлично понимает собеседника и его окружение, например, может помочь собрать кубик Рубика. Griffin-Lite уже доступна для тестирования узкому кругу избранных, а более мощная версия ожидается «очень скоро» — после решения основных вопросов безопасности.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Люди эволюционно приспособлены общаться лицом к лицу: мы используем не только слова, но и интонацию, мимику, жесты и паузы — большая часть человеческой коммуникации невербальна. До сих пор машины этого не понимали и требовали, чтобы мы подстраивались под них, учили их язык — нужную команду, нужный клик, нужный промпт. Стартап Tavus считает, что должно быть наоборот.

HIM — это новый класс моделей ИИ, предназначенных для понимания и генерации человеческого взаимодействия лицом к лицу в реальном времени. Они слушают собеседника и обращают внимание на выражения лица и паузы, а не только на слова. Модель смеется, меняет тон, перебивает и позволяет перебить себя, хорошо чувствует паузы. Плюс отлично следует инструкциям, и видит/понимает собеседника и его окружение (например, может помочь собрать кубик рубика). Griffin объединяет прежние исследования Tavus в области восприятия в реальном времени, разговорной речи и выразительного человекоподобного видео в единую систему video-to-video.

Это первая модель, прошедшая видео-тест Тьюринга в реальном времени: в живом исследовании 48% участников, поговоривших с Griffin, решили, что общались с живым человеком, тогда как прежние системы, включая собственный разговорный видеоинтерфейс Tavus (на базе Phoenix 4.5, Sparrow-2 и Raven-1), давали максимум 2% положительных результатов. Это огромный прорыв в понимании человека машиной. Стартап объясняет его инновационным дуплексным подходом с аудиовизуальной генерацией в режиме реального времени.

Griffin генерирует каждый пиксель в каждом кадре в режиме реального времени, используя всего одно исходное изображение. Система управляет всей сценой целиком: не только лицом, руками и пальцами, но и такими элементами, как движение кресла, в котором сидит человек, отбрасываемые им тени и фон позади него. Каждые доли секунды она решает, стоит ли сейчас молчать, кивнуть, поддакнуть или перебить собеседника, и все это время продолжает смотреть и слушать, в том числе пока говорит сама.

Пока модель доступна только избранным тестировщикам, потому что Tavus действительно уверены, что она способна обмануть человека, заставив его думать, что он говорит не с ИИ; релиз обещают «очень скоро» после проработки безопасности и разработки водяных знаков.

В 1950 году Алан Тьюринг задал вопрос: «Может ли машина мыслить?» — и предложил тест, который должен был дать на него ответ. Почти 75 лет спустя профессор информатики Питер Деннинг в новой книге «Ошибка Тьюринга: как выбраться из-под ига неразумных машин» утверждает, что две ключевые посылки Тьюринга завели исследования ИИ в тупик и стали причиной нынешнего кризиса доверия к искусственному интеллекту.