Microsoft представила MAI-Transcribe-2-Streaming — модель, которая выдаёт промежуточный текст ещё во время речи. Она рассчитана на голосовых агентов, субтитры, диктовку и другие сценарии, где нельзя ждать окончания фразы.
Что произошло
Новая модель принимает непрерывный аудиопоток и возвращает сначала предварительные фрагменты, а затем устойчивую расшифровку. Заявлена поддержка 60 языков и автоматическое определение языка, включая переключение между языками в одном разговоре.
Почему это важно
Для голосового агента задержка между словами пользователя и первым действием часто важнее красивого финального ответа. Если система начинает анализировать просьбу до конца фразы, она получает дополнительное время на вызов инструментов, проверку данных и подготовку ответа.
Контекст для разработчиков
Модель доступна через облачные инструменты Microsoft и совместимые API, а на старте заявлена цена 0,54 доллара за час аудио. Это заметно дороже пакетной расшифровки, поэтому потоковый вариант имеет смысл там, где нужна реакция в разговоре, а не просто готовая стенограмма.
Вывод
Главный сдвиг — не только в точности, а в архитектуре голосовых приложений: распознавание превращается из финального этапа в непрерывный канал событий. Для операторских систем, обучения и ассистентов это может дать более естественный темп диалога.
