Hitech logo

Кейсы

Google выпустила Gemini 3.5 Transcribe — модель распознает и редактирует речь на лету

TODO:
Екатерина ШемякинскаяСегодня, 09:02 AM

Google представила Gemini 3.5 Transcribe — новую модель преобразования речи в текст, которая не просто распознаёт сказанное, но и автоматически редактирует результат. Модель умеет исправлять оговорки, удалять слова-паразиты и форматировать текст, превращая необработанную речь в готовую расшифровку. Модель уже используется в некоторых продуктах Google, а теперь стала доступна разработчикам через API.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Gemini 3.5 Transcribe рассчитана как на работу в реальном времени, так и на обработку записанного аудио. В первом случае модель обеспечивает двунаправленную потоковую передачу с задержкой менее секунды — это подходит для голосовых ассистентов и субтитров. При анализе записанных звонков и встреч Gemini 3.5 Transcribe умеет расставлять временные метки и разделять реплики участников. На данный момент система стабильно распознаёт до трёх спикеров

Главное отличие новой модели от традиционных систем распознавания речи — способность учитывать контекст высказывания. Например, если человек говорит «встретимся во вторник — нет, в среду», Gemini 3.5 Transcribe может сразу внести исправление в итоговый текст. Модель также удаляет «э-э» и другие слова-паразиты, распознаёт специализированную терминологию из пользовательского словаря и может работать с буквенно-цифровыми последовательностями вроде индексов и номеров заказов.

Google также сообщает о заметном приросте скорости по сравнению с Chirp 3, предыдущим движком преобразования голоса в текст. По данным Artificial Analysis, время до получения окончательной транскрипции сократилось на 70%. В той же оценке средний показатель ошибок распознавания слов (WER) составил 4,0% для потоковой и 2,6% для непотоковой транскрипции. На отдельном многоязычном бенчмарке FLEURS модель показала WER на уровне 5,50% в потоковом режиме и 5,04% при обработке записанного аудио.

Модель поддерживает более 85 языков и умеет автоматически переключаться между ними во время разговора.

Google уже использует её в функции Rambler на Android и в приложении Gemini для macOS. В последнем случае голосовой ввод можно связать с контекстом экрана — например, с помощью голоса анализировать локальные файлы, перерабатывать текст между приложениями или запускать генерацию изображений.

Разработчики могут подключать Gemini 3.5 Transcribe через два API: Live API для потоковой транскрипции и Interactions API для предварительно записанного аудио. Модель также появилась в Google AI Studio и Google Antigravity, где может использовать контекст экрана и историю чата с разрешения пользователя.

Кроме того, Google планирует добавить аналогичную функцию голосового ввода в Chrome, чтобы пользователи могли диктовать текст в любые веб-поля.

«Умная» транскрипция меняет сам принцип голосового ввода: модель пытается восстановить то, что человек хотел сказать, а не просто дословно записать его речь. В Ars Technica отмечают, что такой подход удобен для обычной диктовки, но может быть нежелателен там, где важна буквальная передача сказанного.