Microsoft вывела потоковую расшифровку MAI-Transcribe-2-Streaming в реальное время

Microsoft представила MAI-Transcribe-2-Streaming — модель, которая выдаёт промежуточный текст ещё во время речи. Она рассчитана на голосовых агентов, субтитры, диктовку и другие сценарии, где […]

Microsoft вывела потоковую расшифровку MAI-Transcribe-2-Streaming в реальное время

Microsoft представила MAI-Transcribe-2-Streaming — модель, которая выдаёт промежуточный текст ещё во время речи. Она рассчитана на голосовых агентов, субтитры, диктовку и другие сценарии, где нельзя ждать окончания фразы.

Что произошло

Новая модель принимает непрерывный аудиопоток и возвращает сначала предварительные фрагменты, а затем устойчивую расшифровку. Заявлена поддержка 60 языков и автоматическое определение языка, включая переключение между языками в одном разговоре.

Почему это важно

Для голосового агента задержка между словами пользователя и первым действием часто важнее красивого финального ответа. Если система начинает анализировать просьбу до конца фразы, она получает дополнительное время на вызов инструментов, проверку данных и подготовку ответа.

Контекст для разработчиков

Модель доступна через облачные инструменты Microsoft и совместимые API, а на старте заявлена цена 0,54 доллара за час аудио. Это заметно дороже пакетной расшифровки, поэтому потоковый вариант имеет смысл там, где нужна реакция в разговоре, а не просто готовая стенограмма.

Вывод

Главный сдвиг — не только в точности, а в архитектуре голосовых приложений: распознавание превращается из финального этапа в непрерывный канал событий. Для операторских систем, обучения и ассистентов это может дать более естественный темп диалога.