GPT-Live-1: Теперь разработчики могут создавать приложения, которые слушают и говорят одновременно

3 мин чтения 0
GPT-Live-1: Теперь разработчики могут создавать приложения, которые слушают и говорят одновременно

OpenAI has quietly made GPT-Live-1 available as an API. The speech model can listen and respond in real time simultaneously — full-duplex voice, not alternating push-to-talk. Developers pay $0.05 per minute.

Суть события

OpenAI запустила GPT-Live-1 как API для разработчиков. До этого модель работала только внутри ChatGPT — в интерфейсе, где пользователь нажимает кнопку и ждёт ответа. Теперь её можно встроить в своё приложение. Ключевая способность — полнодуплексный режим: модель одновременно слышит собеседника и говорит сама, а не ждёт очереди, как традиционные голосовые ассистенты.

API позволяет комбинировать голосовую модель с разными бэкенд-моделями: глубина рассуждений, скорость и стоимость подбираются под конкретную задачу. Например, простой бот для записи к врачу может использовать быструю и дешёвую модель, а сложная юридическая консультация — мощную и дорогую.

Детали

На бенчмарках OpenAI GPT-Live-1 значительно обходит предыдущие модели. В тестах на полнодуплексную интерактивность модель набирает 80,1% против 45,4% у GPT-Realtime-2.1. Задержка в переключении ролей упала с 1,4 до 0,8 секунды. Точность вызова инструментов выросла с 60% до 87%. В банковском бенчмарке голосовой поддержки показатель прохождения поднялся с 12,4% до 32%.

Yelp уже использует модель для бронирования столиков по телефону — об этом рассказал CTO компании Алекс Леви. По его словам, модель обрабатывает звонки лучше, чем предыдущее решение. Цена — $0,05 за минуту, что заметно дороже текстового API, но вполне сопоставимо с затратами на оператора для простых повторяющихся задач.

Вместе с моделью представлены двенадцать новых голосов с разными акцентами, диалектами и языками. API сразу отдаёт ASR-транскрипт и текст ответа — не нужно дополнительно обрабатывать аудио.

Контекст

До сих пор голосовые ассистенты работали по схеме «говори — жди — слушай». Каждая реплика была отдельным запросом, и пауза между ними убивала естественность разговора. GPT-Live-1 убирает эту паузу, имитируя нормальный человеческий диалог, где собеседник может перебить, уточнить или сам начать говорить.

Для обычного пользователя это означает: голосовые интерфейсы наконец перестают звучать как роботы из 2010-х. Hands-free рецепт во время готовки, перевод в реальном времени, звонки в службу поддержки без меню и ожидания — сценарии, которые раньше требовали отдельного решения для каждого. Подробнее о развитии голосовых моделей — в материале AI Digest про GPT-6 Astra.

Что дальше

Главный вопрос — цена. $0,05 за минуту звонка. Для сравнения, 30-минутный разговор стоит как две недели текстовой подписки на ChatGPT. Для бизнеса это уже конкурирует с живым оператором начального уровня, но для массового потребителя пока дорого. Если рынок голосовых API будет расти так же, как рынок текстовых, цена упадёт — вопрос времени.

OpenAI открыла доступ, но конкуренция усиливается. Google, Amazon и специализированные стартапы не собираются уступать. Следующий этап — когда стоимость и качество голосового API достигнут точки, когда встраивать ассистента в своё приложение станет дешевле, чем держать живого сотрудника на простых задачах.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх