Google выпустила Gemini 3.5 Transcribe — модель для расшифровки речи в реальном времени и из записей. Она автоматически определяет более 85 языков, убирает слова-паразиты и приводит сбивчивую речь в читаемый вид. Для созвонов, интервью и голосового ввода это может означать заметно меньше ручной чистки текста.
Суть события
Gemini 3.5 Transcribe превращает аудио в уже подготовленный текст, а не просто выдаёт дословную стенограмму. Модель распознаёт язык без ручного переключения, расставляет форматирование, убирает «э-э» и похожие заполнители пауз, а также исправляет очевидные речевые оговорки. Здесь есть тонкий момент: такая коррекция удобна, пока система не начинает менять смысл сказанного. Поэтому для юридических разговоров, медицины и журналистских цитат исходную запись всё равно придётся хранить.
Google заявляет частоту ошибок в словах 4,0% для потоковой речи и 2,6% для заранее записанного аудио. Задержка по сравнению с Chirp 3 снижена на 70%. Это уже не косметическое обновление: быстрая расшифровка делает голосовой интерфейс пригодным там, где ответ должен появляться почти одновременно с речью.
Детали
Для разных сценариев предусмотрены два программных интерфейса (API). Live API обрабатывает поток в реальном времени — например, совещание, звонок службы поддержки или диктовку. Interactions API работает с готовой записью, добавляет временные метки и различает говорящих. Модель уже доступна в Google AI Studio и на платформе Gemini Enterprise Agent Platform.
Есть и необычная связка с другими инструментами: через function calling расшифровка может передать следующую задачу другой модели Gemini — например, запустить поиск или подготовить изображение. Получается цепочка, в которой голос становится входом для рабочего процесса, а не конечным файлом со стенограммой.
Технология уже используется в Gboard на Android и в приложении Gemini для macOS; поддержку Chrome компания обещает добавить позже. Сведений о самостоятельной цене новой модели в опубликованных материалах пока нет.
Контекст
Рынок распознавания речи постепенно смещается от вопроса «правильно ли разобраны слова» к вопросу «можно ли сразу использовать результат». Компаниям важны разделение спикеров, временные метки, аккуратная пунктуация и минимальная задержка: именно на последующей вычитке обычно теряются часы сотрудников.
Для Google это ещё один способ связать Gemini с повседневным вводом — от клавиатуры телефона до корпоративных агентов. Похожую стратегию компания использует и в других продуктах Gemini: модель становится слоем между привычным действием человека и следующей автоматической операцией. О развитии этой экосистемы мы рассказывали в материале о фоновых агентах и поддержке протокола MCP в программном интерфейсе Gemini: https://ai-digest.ru/google-deepmind-dobavila-fonovye-agenty-i-podderzhku-mcp-v-gemini-api/
Что дальше
Практический тест для новой модели простой: как она справится с шумом, акцентами, перебиваниями и смешением языков в одном разговоре. Заявленные проценты выглядят сильно, но усреднённая метрика не гарантирует одинакового качества в каждом из 85 языков.
Если точность подтвердится на живых записях, выиграют команды поддержки, редакции, исследователи и все, кто регулярно разбирает созвоны. Но автоматическое «исправление» речи стоит включать осознанно: для конспекта оно полезно, для точной цитаты — потенциально опасно.