Новости

От текста к голосу: Google, OpenAI и Microsoft инвестируют миллиарды в устное общение с ИИ

Алексей Алоисов

Google, OpenAI и Microsoft активно инвестируют в технологии, которые позволяют общаться с ИИ-агентами голосом, рассчитывая на рост популярности устного общения с ИИ по сравнению с текстовыми запросами. Это направление всё чаще называют голосовым ИИ. Интерес инвесторов подтверждают данные PitchBook, которые приводит Financial Times: стартапы в сфере голосового ИИ в первом квартале 2026 года привлекли около $7 млрд — в семь раз больше, чем за аналогичный период 2025 года.

Расчёт делается на то, что устная речь постепенно потеснит текстовый ввод как основной способ общения с ИИ. Показатели крупных игроков рынка это подтверждают.

Google фиксирует рост голосовых и визуальных запросов

По данным Google, число запросов в режиме AI Mode увеличивалось более чем вдвое каждый квартал начиная с запуска сервиса и вплоть до апреля–мая 2026 года. В США голос или изображения теперь применяются более чем в каждом шестом поисковом запросе, а количество обращений с картинками растёт более чем на 40% в месяц. Компания связывает эту динамику с тем, что пользователи всё чаще выбирают формат общения, близкий к естественной речи, вместо набора текста.

Ставка OpenAI на голос

Из примерно 900 млн еженедельных активных пользователей ChatGPT — эту цифру компания назвала в конце февраля 2026 года — более 150 млн человек каждую неделю используют голос и диктовку для общения с сервисом.

8 июля 2026 года OpenAI запустила семейство моделей GPT-Live: GPT-Live-1 и облегчённую GPT-Live-1 mini. Это full-duplex модели, способные одновременно слушать собеседника и отвечать ему, без привычной паузы «запрос — ответ». Именно они легли в основу обновлённого ChatGPT Voice.

Помимо программной части, OpenAI готовит и отдельное устройство. По сведениям источников Bloomberg, компания разрабатывает экранлесс-смарт-спикер с камерой и сенсорами на базе GPT-Live. Анонс возможен ещё в 2026 году, а выпуск на рынок ожидается в начале 2027-го.

Microsoft развивает экспрессивный синтез речи

Microsoft в июне 2026 года представила модель MAI-Voice-2 — экспрессивный синтезатор речи с поддержкой 15 языков и управлением эмоциональной окраской голоса. Технология уже интегрируется в продукты компании, включая Dynamics 365 Contact Center и Azure Voice Live.

Среди основных направлений, где компании делают ставку на голосовой ИИ:

  • поиск и работа с ИИ-агентами через устную речь и изображения

  • full-duplex голосовые модели для более естественного диалога

  • отдельные аппаратные устройства для голосового взаимодействия

  • синтез речи с контролем эмоций для корпоративных сервисов

Рост инвестиций и одновременные анонсы у Google, OpenAI и Microsoft показывают, что голосовые интерфейсы переходят из разряда экспериментальных функций в самостоятельное направление развития ИИ-продуктов. Дальнейшее распространение таких технологий будет зависеть от того, насколько быстро пользователи адаптируют новые способы взаимодействия в повседневных сценариях.

Мнение ИИ

С точки зрения регуляторной динамики бум голосового ИИ несет риск, который обошли стороной инвесторы и разработчики: доверие пользователя к «человечности» интерфейса. Пока Google, OpenAI и Microsoft соревнуются в естественности диалога, депутаты Госдумы уже направили в ФАС предложение обязать голосовых роботов раскрывать свою природу с первых секунд звонка. Разрыв между технологической гонкой за «эффектом присутствия» и попытками регуляторов сохранить границу между человеком и машиной способен стать таким же значимым фактором рынка, как объем инвестиций.

Исторический паттерн подсказывает осторожность: голосовые ассистенты уже переживали цикл завышенных ожиданий во времена первых версий Siri и Alexa, когда массовое внедрение не оправдало прогнозов монетизации. Открытым остается вопрос, окажется ли текущая волна full-duplex моделей реальным сдвигом в восприятии технологии или очередным витком того же цикла.


Самые интересные и важные новости на нашем канале в Telegram