Hitech logo

Кейсы

ElevenLabs выпустила речевые модели v4 с поддержкой 90 языков

TODO:
Екатерина ШемякинскаяСегодня, 02:40 PM

ElevenLabs представила две новые модели синтеза речи — Eleven v4 и Eleven v4 Turbo. Они получили более точный контроль над интонацией и эмоциональной подачей, поддержку более 90 языков и меньшую задержку при работе голосовых ИИ-агентов. Eleven v4 ориентирована на максимально выразительную речь, а Turbo — на использование в режиме реального времени.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Eleven v4 теперь внимательнее учитывает контекст при озвучивании — может менять темп, интонацию и эмоциональную подачу в зависимости от ситуации, сохраняя при этом голос говорящего. Модель также лучше работает с длинными фрагментами и диалогами с несколькими персонажами, что актуально для аудиокниг.

В предыдущей версии ElevenLabs добавила теги для управления выражением речи, которые позволяют вставлять указания на естественном языке, например, «[смеется]» или «[шепотом]». В v4 система стала лучше учитывать последовательность таких скриптов и сочетать несколько тегов при генерации речи. Компания также заявляет, что новая модель надежнее сохраняет особенности голоса на протяжении длинных фрагментов текста.

Количество поддерживаемых языков выросло с 70 в Eleven v3 до более чем 90 в новом поколении. В компании отмечают особенно заметное улучшение качества для японского, бразильского португальского, мандаринского и кантонского китайского. Среди поддерживаемых языков также есть русский, украинский, польский, литовский и другие языки.

Одновременно ElevenLabs упростила клонирование голосов. Для функции мгновенного клонирования достаточно 10 секунд аудиозаписи.

Eleven v4 Turbo предназначена прежде всего для голосовых агентов и других приложений, где важна скорость ответа. В собственных тестах ElevenLabs медианное время до первого фрагмента речи у v4 Turbo составило 150 мс — против 262 мс у Cartesia Sonic 3.6 и 814 мс у OpenAI GPT-4o mini TTS. Модель может начинать генерировать аудио еще до того, как языковая модель полностью сформирует ответ, что позволяет сделать диалог с голосовым агентом плавнее. Кроме того, модель лучше справляется с конфликтными ситуациями во время звонков, что особенно важно для корпоративных колл-центров.

Новинки выходят на фоне усиления конкуренции на рынке генерации речи: собственные голосовые системы развивают Google и OpenAI, а среди специализированных стартапов конкурируют Cartesia, Deepgram, Fish Audio и другие компании. ElevenLabs в феврале привлекла $500 млн при оценке в $11 млрд. Компания продолжает расширять корпоративный бизнес и, по словам ее гендиректора Мати Станишевски, планирует провести IPO в ближайшие годы.