Microsoft представила MAI-Transcribe-2-Streaming и два варианта MAI-Voice-2.1 — набор моделей, который должен сделать голосовых агентов быстрее, дешевле и естественнее.
Суть события
Microsoft выпустила новую связку моделей для голосовых интерфейсов. MAI-Transcribe-2-Streaming переводит речь в текст почти в реальном времени, а MAI-Voice-2.1 и MAI-Voice-2.1-Flash отвечают за обратное превращение текста в голос. Речь идёт не о демонстрационном чат-боте, а об инфраструктуре для сервисов поддержки, голосового поиска и автоматизированных операторов.
Главный эффект — сокращение паузы между словами пользователя и ответом системы. Microsoft заявляет, что первая частичная расшифровка появляется чуть больше чем через 100 миллисекунд. Благодаря этому агент может начать реагировать, пока человек ещё заканчивает фразу.
Детали
MAI-Transcribe-2-Streaming поддерживает 60 языков. На момент запуска Microsoft называет его самым точным в рейтинге Artificial Analysis. Вводная цена до конца года — $0,54 за час аудио. Это особенно важно для компаний, где стоимость распознавания складывается из тысяч ежедневных звонков.
MAI-Voice-2.1 умеет говорить на 23 языках, сохраняя один и тот же голос и используя естественное произношение для каждого языка. Версия Flash ориентирована на скорость: заявленная задержка — 150 миллисекунд, а цена — $15 за миллион символов вместо $22. Обе модели могут клонировать голос по нескольким секундам образца. Встроенные ограничения должны снижать риск злоупотреблений.
Модели доступны через Microsoft Foundry и MAI Playground; голосовые версии также появились на OpenRouter. В одном тесте примерно половина из 4000 участников приняла синтетические голоса за речь реального человека.
Контекст
Для голосового агента важна не только точность отдельных слов. Система должна быстро распознавать перебивания, выдерживать естественный темп и отвечать без заметной паузы. Новая связка Microsoft закрывает обе стороны этого цикла: слух и речь.
При этом заявленные показатели требуют проверки в реальных сценариях. Итоговую цену определят объём аудио, выбранный канал и дополнительные расходы платформы. А клонирование голоса остаётся чувствительной функцией: бизнесу понадобятся согласие владельца голоса, журналирование и защита от подмены личности. Для сравнения подходов к распознаванию можно посмотреть материал о возможностях Gemini 3.5 Transcribe.
Что дальше
Следующий практический шаг для команды — прогнать собственные записи через обе части связки и измерить не только задержку, но и ошибки на именах, цифрах, акцентах и перебиваниях. Затем стоит посчитать стоимость полного диалога: распознавание, генерация ответа и озвучивание.
Если результаты подтвердятся, голосовые агенты станут доступнее для узких B2B-сценариев: первичной поддержки, обработки заявок и многоязычных линий. Но качество разговора будет зависеть от всей цепочки, а не от одного красивого показателя задержки.