Google выпустила новое поколение голосовых моделей Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, способных рассуждать и одновременно вести диалог без пауз на «подумать».
Что произошло
15 сентября Google анонсировала две модели для голосовых ИИ-агентов: базовую Gemini 3.8 Live, рассчитанную на массовые и недорогие сценарии, и продвинутую Extended Thinking — для сложных многошаговых задач. Обе распознают речь и отвечают голосом в реальном времени, автоматически переключаются между 97 языками прямо посреди разговора и умеют «подглядывать» в видео с камеры, комментируя происходящее на лету.
Почему это важно
Главная проблема голосовых ассистентов до сих пор — неловкая пауза, когда модель «задумывается» перед сложным ответом или вызовом внешнего инструмента. Extended Thinking решает это иначе: модель проговаривает промежуточные фразы вроде «сейчас проверю» и продолжает рассуждать и выполнять фоновые задачи, не обрывая беседу. По собственным данным Google, модель заняла первое место в рейтинге качества речевых ИИ Artificial Analysis и обошла аналогичные голосовые модели OpenAI по параметрам выполнения сложных агентных сценариев.
Контекст и что дальше
Новые модели уже доступны через Gemini API и AI Studio, а Extended Thinking постепенно подключается к продуктам Google — Gemini Live, Search Live, а также голосовым версиям Gmail, Google Docs и Keep для подписчиков. Партнёрами по внедрению выступили Salesforce и ряд других компаний, использующих голосовых агентов в поддержке клиентов. Для конечных пользователей это означает, что голосовые помощники в привычных приложениях Google станут заметно быстрее реагировать на сложные запросы и меньше «зависать» посреди фразы.



