Ранние голосовые ассистенты работали в несколько этапов: сначала преобразовывали речь в текст, затем обрабатывали запрос языковой моделью и снова переводили ответ в голос. Из-за этого появлялись задержки, терялся контекст разговора, а ответы звучали механически. Новые системы обрабатывают речь напрямую, что позволяет учитывать интонацию, акценты и другие особенности человеческой речи.
Интерес к голосовому формату отмечают ведущие компании в сфере ИИ. В Google сообщили, что количество пользователей их голосового режима за год удвоилось, а разговоры с ИИ в среднем продолжаются в пять раз дольше, чем текстовые сессии.
OpenAI заявила, что голосовой режим ChatGPT еженедельно используют более 150 млн человек. По мнению разработчиков, голос особенно удобен для задач, где человеку нужно долго объяснять цель, ограничения и контекст.
Голосовой режим способен стать удобным инструментом для программистов. Разработчики могут полнее описывать свои намерения в разговоре, чем в коротком текстовом запросе — например, объяснять, какую проблему решают, почему возникла ошибка и какой результат нужен. В OpenAI отмечают, что такой подход уже помогает при работе с Codex для написания кода. А инженеры Microsoft стали использовать голос для управления задачами программирования на GitHub.
OpenAI и Google также совершенствуют стиль общения своих моделей. В Google отметили, что пользователи быстрее привыкают к ИИ, когда модели ведут себя как естественные собеседники и поддерживают более живую спонтанную речь. OpenAI недавно представила обновление ChatGPT Live, назвав его первым крупным апдейтом голосовой модели за последние два года.
Развитие голосового ИИ стимулирует появление нового класса устройств. Стартапы разрабатывают портативные диктофоны, голосовые кольца и другие гаджеты, которые могут постоянно принимать команды пользователя и делать заметки.
По данным PitchBook, инвестиции в компании, которые занимаются голосовым ИИ, достигли $7 млрд в первом квартале года против менее $1 млрд годом ранее. При этом OpenAI, по сообщениям СМИ, также работает над собственным устройством с камерой, микрофоном и динамиком.
Однако переход к голосовому взаимодействию пока сталкивается с рядом проблем. ИИ-системы все еще могут ошибаться в условиях фонового шума, плохо распознавать некоторые акценты и неправильно интерпретировать эмоциональный тон. Эксперты считают, что именно качество работы в реальных условиях, от улицы до офиса, определит, сможет ли голос стать главным способом общения человека с искусственным интеллектом.

