Qwen3.8-Omni-Flash сравнялась с Gemini Flash в мультимодальных тестах и заметно снизила цену

3 мин чтения 0
Qwen3.8-Omni-Flash сравнялась с Gemini Flash в мультимодальных тестах и заметно снизила цену

Qwen представила Qwen3.8-Omni-Flash — модель для работы с текстом, звуком и видео, которая, по данным компании, приблизилась к Gemini 3.8 Flash в аудиовизуальных тестах, но стоит существенно дешевле через API. Это важно разработчикам и компаниям, которые хотят поручать ИИ перевод роликов, монтаж и разбор длинных записей без резкого роста расходов.

Суть события

Qwen3.8-Omni-Flash стала первой мультимодальной моделью Qwen, специально созданной для ИИ-агентов. Мультимодальная модель — это система, которая умеет совместно обрабатывать несколько типов данных: в данном случае текст, аудио и видео. Она может анализировать ролик, делать выводы и самостоятельно применять инструменты, например для перевода короткого видео, монтажа влога или подготовки пересказа фильма.

Главный практический аргумент — цена API, то есть программного интерфейса для подключения модели к приложениям. Один миллион входных токенов стоит $0,15, а выходных — $0,47. Токен — небольшой фрагмент данных, который модель принимает или создаёт. Для сравнения, ввод в Gemini 3.8 Flash по стартовому тарифу стоит $0,75 за миллион токенов, вывод — $3,75; заявлено, что с 1 января 2027 года эти цены удвоятся.

Детали

Контекстное окно Qwen3.8-Omni-Flash достигает одного миллиона токенов. Проще говоря, модель способна удерживать в одной задаче очень большой объём исходного материала. Qwen оценивает обработку часа аудио менее чем в один цент, а видео 720p со звуком при анализе одного кадра в секунду — примерно в $0,20 без учёта стоимости ответа.

По собственным тестам Qwen, на задачах со звуком и видео модель близка к Gemini 3.8 Flash. Это утверждение производителя, поэтому его полезно проверять на реальных материалах конкретной команды: качестве распознавания речи, точности перевода, монтаже и задержке ответа. Низкая цена сама по себе не гарантирует подходящий результат.

Контекст

Модель доступна через Qwen Studio, Qwen Cloud и API. Дополнительный открытый набор Qwen-MM-Plugins добавляет редактирование видео, распознавание говорящих, видеозаметки по PDF и повторно используемые рабочие процессы для Claude Code, Gemini CLI и Qwen Code. Qwen-Live Harness поддерживает взаимодействие в реальном времени через камеру и микрофон.

Для рынка это давление на стоимость мультимодальных сервисов. Команды, которые массово обрабатывают звонки, обучающие записи или пользовательские ролики, получают более дешёвую альтернативу для пилотных проектов. Однако итоговая экономика зависит не только от тарифа: придётся учитывать качество ответа, объём повторных запросов, интеграцию и контроль ошибок. Для сравнения подходов полезен наш материал о том, как Google позиционирует Gemini 3.8 Flash.

Что дальше

Разработчикам стоит начать с небольшой выборки собственных аудио и видео и посчитать стоимость завершённой задачи, а не миллиона токенов. Такой тест покажет, сколько ручной проверки требуется и сохраняется ли преимущество Qwen после исправлений.

Следующий вопрос — подтвердятся ли заявленные результаты вне тестов Qwen. Если качество окажется стабильным, более низкий тариф может сделать автоматический перевод, каталогизацию видео и подготовку чернового монтажа доступнее небольшим компаниям и независимым авторам.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх