Google представил голосовые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking — систему, которая понимает речь, видит происходящее через камеру и рассуждает прямо во время разговора, не дожидаясь окончания реплики.
Главное отличие от предыдущих голосовых ассистентов — модель может держать в уме контекст визуальной сцены (например, что показывает пользователь через камеру телефона) и одновременно вести диалог с паузами на обдумывание сложных вопросов. Версия Extended Thinking заточена именно под задачи, где нужна пошаговая логика: планирование, расчёты, разбор технических вопросов на лету.
По независимым замерам Artificial Analysis, Extended Thinking набрала 82,6 балла в индексе качества речь-в-речь — на сегодня один из лучших результатов среди голосовых моделей на рынке. Это важно не только как цифра: разница между «прилично понимает на слух» и «действительно держит нить рассуждения» ощущается в живом разговоре сразу.
Что это меняет для пользователей
Практическая ценность голосовых моделей с рассуждением — в сценариях, где раньше приходилось переключаться в текстовый чат: разбор показаний приборов через камеру, живой перевод с пояснением контекста, помощь в задачах на ходу без набора текста. Extended Thinking может выполнять фоновые задачи параллельно с разговором — то есть отвечать голосом и одновременно, например, искать информацию.
Пока не обошлось без огрехов роста: часть пользователей уже отмечает, что модель теряет контекст между соседними репликами и не всегда сохраняет историю диалога между сессиями — стандартная болезнь молодых голосовых систем, которую обычно правят следующими обновлениями.
Для локальной экосистемы AI-инструментов это важный сигнал: голосовое взаимодействие с рассуждением в реальном времени перестаёт быть нишевой фичей и становится ожидаемым стандартом — конкурентам придётся догонять по этому же направлению.



