
Qwen 3.8 Max догнала Claude Opus 4.8 по бенчмаркам, но всё ещё уступает Kimi K3
Alibaba представила Qwen 3.8 Max — новую версию открытой модели, которая набирает 56 баллов в рейтинге Artificial Analysis Intelligence Index. Это примерно уровень Claude Opus 4.8 и заметный рывок по сравнению с Qwen 3.7 Max (46 баллов). Однако реальная стоимость одного запроса оказалась выше, чем у конкурента Kimi K3.
Суть: бенчмарки растут, но эффективность не всегда
Главный урок из данных Artificial Analysis: высокие баллы в рейтинге не всегда означают лучшую эффективность в реальных задачах. Qwen 3.8 Max использует в несколько раз больше вычислительных шагов, чем предыдущая версия, и тратит больше токенов на каждый запрос. Это делает её дороже в эксплуатации, даже если цена за миллион токенов снизилась.
Цифры и что они значат
Согласно данным Artificial Analysis, Qwen 3.8 Max набирает 56 баллов в сводном рейтинге Intelligence Index — на 10 баллов больше предыдущей версии. В тесте GDPval-AA на рабочие задачи модель набрала 468 пунктов и обошла Kimi K3 (1685), уступив только Claude Opus 5 (1852).
Но есть нюанс. Qwen 3.8 Max использует 64 шага на задачу вместо 14, а входные токены выросли в 15 раз, потому что тест каждый раз отправляет полную историю диалога. Один запрос в Intelligence Index теперь стоит 1,14 доллара — более чем вдвое больше, чем у Qwen 3.7 Max (0,53 доллара). Kimi K3, при этом, набирает на балл выше (57) и стоит всего 0,86 доллара за задачу.
Что подешевело и подорожало
Alibaba снизила цены на токены: входные — с 2,50 до 2,00 долларов за миллион, выходные — с 7,50 до 6,00 долларов. Кэшированные обращения подешевели с 0,50 до 0,25 долларов. Однако из-за роста числа шагов и токенов на задачу итоговая стоимость использования выросла. Подробнее о ценах на API различных моделей можно узнать в сравнении Claude, Gemini и GPT.
Среди регрессий: тест AA-LCR упал на 2 балла (способность собирать информацию из длинных текстов), а AA-Omniscience — на 10 баллов (честность ответов). Частота «угадываний» вместо признания незнания выросла с 23% до 40%.
Что дальше: выбор между баллами и экономикой
Для разработчиков и компаний, которые выбирают модель для рабочих задач, Qwen 3.8 Max предлагает результат, близкий к Claude Opus 4.8, но с повышенным потреблением токенов и более частыми «галлюцинациями». Kimi K3 остаётся более предсказуемым вариантом по соотношению цена-качество. Для Alibaba следующим шагом будет оптимизация архитектуры, чтобы снизить стоимость одного запроса без потери баллов.
Для рынка Qwen 3.8 Max — это демонстрация того, что открытые модели Alibaba продолжают сокращать разрыв с закрытыми лидерами. Однако модель показывает паттерн, знакомый по предыдущим итерациям: рост показателей часто сопровождается увеличением вычислительных затрат. Kimi K3 при этом остаётся более эффективным по соотношению цена-качество, что делает её привлекательнее для приложений с высокой частотой запросов.
Для разработчиков, которые выбирают открытую модель для рабочих задач, Qwen 3.8 Max предлагает уровень, близкий к Claude Opus 4.8, но с особенностями в виде повышенного потребления токенов и более частых «галлюцинаций». Если вам нужна модель для рабочих задач с предсказуемым качеством — смотрите сравнение Kimi K3 и Claude.
Подберите сервис под задачу и начните работать сегодня
ChatGPT, Claude, Gemini, MiniMax и другие инструменты для текстов, кода, изображений и автоматизации — без долгого поиска вариантов.
Партнёрская подборка AI Digest. Продажу и оплату проводит продавец через DigiSeller; AI Digest может получить комиссию без изменения цены.