Qwen 3.8 Max догнала Claude Opus 4.8 по бенчмаркам, но всё ещё уступает Kimi K3

Qwen 3.8 Max догнала Claude Opus 4.8 по бенчмаркам, но всё ещё уступает Kimi K3

Qwen 3.8 Max догнала Claude Opus 4.8 по бенчмаркам, но всё ещё уступает Kimi K3

Alibaba представила Qwen 3.8 Max — новую версию открытой модели, которая набирает 56 баллов в рейтинге Artificial Analysis Intelligence Index. Это примерно уровень Claude Opus 4.8 и заметный рывок по сравнению с Qwen 3.7 Max (46 баллов). Однако реальная стоимость одного запроса оказалась выше, чем у конкурента Kimi K3.

Суть: бенчмарки растут, но эффективность не всегда

Главный урок из данных Artificial Analysis: высокие баллы в рейтинге не всегда означают лучшую эффективность в реальных задачах. Qwen 3.8 Max использует в несколько раз больше вычислительных шагов, чем предыдущая версия, и тратит больше токенов на каждый запрос. Это делает её дороже в эксплуатации, даже если цена за миллион токенов снизилась.

Цифры и что они значат

Согласно данным Artificial Analysis, Qwen 3.8 Max набирает 56 баллов в сводном рейтинге Intelligence Index — на 10 баллов больше предыдущей версии. В тесте GDPval-AA на рабочие задачи модель набрала 468 пунктов и обошла Kimi K3 (1685), уступив только Claude Opus 5 (1852).

Но есть нюанс. Qwen 3.8 Max использует 64 шага на задачу вместо 14, а входные токены выросли в 15 раз, потому что тест каждый раз отправляет полную историю диалога. Один запрос в Intelligence Index теперь стоит 1,14 доллара — более чем вдвое больше, чем у Qwen 3.7 Max (0,53 доллара). Kimi K3, при этом, набирает на балл выше (57) и стоит всего 0,86 доллара за задачу.

Что подешевело и подорожало

Alibaba снизила цены на токены: входные — с 2,50 до 2,00 долларов за миллион, выходные — с 7,50 до 6,00 долларов. Кэшированные обращения подешевели с 0,50 до 0,25 долларов. Однако из-за роста числа шагов и токенов на задачу итоговая стоимость использования выросла. Подробнее о ценах на API различных моделей можно узнать в сравнении Claude, Gemini и GPT.

Среди регрессий: тест AA-LCR упал на 2 балла (способность собирать информацию из длинных текстов), а AA-Omniscience — на 10 баллов (честность ответов). Частота «угадываний» вместо признания незнания выросла с 23% до 40%.

Что дальше: выбор между баллами и экономикой

Для разработчиков и компаний, которые выбирают модель для рабочих задач, Qwen 3.8 Max предлагает результат, близкий к Claude Opus 4.8, но с повышенным потреблением токенов и более частыми «галлюцинациями». Kimi K3 остаётся более предсказуемым вариантом по соотношению цена-качество. Для Alibaba следующим шагом будет оптимизация архитектуры, чтобы снизить стоимость одного запроса без потери баллов.

Для рынка Qwen 3.8 Max — это демонстрация того, что открытые модели Alibaba продолжают сокращать разрыв с закрытыми лидерами. Однако модель показывает паттерн, знакомый по предыдущим итерациям: рост показателей часто сопровождается увеличением вычислительных затрат. Kimi K3 при этом остаётся более эффективным по соотношению цена-качество, что делает её привлекательнее для приложений с высокой частотой запросов.

Для разработчиков, которые выбирают открытую модель для рабочих задач, Qwen 3.8 Max предлагает уровень, близкий к Claude Opus 4.8, но с особенностями в виде повышенного потребления токенов и более частых «галлюцинаций». Если вам нужна модель для рабочих задач с предсказуемым качеством — смотрите сравнение Kimi K3 и Claude.

Готовые AI-доступы

Подберите сервис под задачу и начните работать сегодня

ChatGPT, Claude, Gemini, MiniMax и другие инструменты для текстов, кода, изображений и автоматизации — без долгого поиска вариантов.

Авто-выдача после оплаты Популярные AI-сервисы Варианты под разные задачи
Все товары

Партнёрская подборка AI Digest. Продажу и оплату проводит продавец через DigiSeller; AI Digest может получить комиссию без изменения цены.

Прокрутить вверх