Qwen3.8 max от alibaba: финальный релиз с Api, оценками и агрессивной ценой

3 августа Alibaba выпустила финальную версию Qwen3.8 Max - и это уже не "анонс в витрине", а модель, у которой появился рабочий API, независимые оценки и, что особенно заметно, крайне агрессивный ценник. В июле вокруг предварительной версии было много обещаний: 2,4 трлн параметров, смесь экспертов, "уровень сразу под Claude Fable 5", а вот проверять тогда было почти нечем - ни полноценной карточки модели, ни массовых внешних тестов, ни прайса, ни доступных весов. Теперь базовые вопросы можно разложить по полкам: насколько сильна, сколько стоит, где запускать и можно ли скачать.

Что именно выпустила Alibaba

Qwen3.8 Max - нативная мультимодальная модель со смесью экспертов (MoE) и заявленными 2,4 трлн параметров. На вход она принимает текст, изображения и видео, а на выходе возвращает текст. Главный инфраструктурный козырь - контекст до 1 миллиона токенов. В "режиме мышления" указаны лимиты вплоть до 983 тысяч входных и 131 тысячи выходных токенов, то есть модель нацелена не только на длинное чтение, но и на длительное рассуждение с большим объёмом ответа.

Миллион токенов - это примерно "десять романов" по объёму либо несколько крупных кодовых баз с документацией. На практике такой контекст снижает привычные издержки: меньше нарезки документов на чанки, меньше повторных подач, меньше риска, что важный фрагмент "выпал" из окна внимания. Однако сам по себе большой контекст не гарантирует качество: многое зависит от структуры исходных материалов, разметки, повторов и того, как вы формулируете задачу (например, просите ли модель цитировать опорные фрагменты и придерживаться единого плана).

Агентные функции и "гибридное мышление"

Гибридное мышление включено по умолчанию: Qwen3.8 Max умеет вызывать функции, работать со встроенными инструментами и отдавать структурированный результат. Alibaba отдельно позиционирует модель для программирования и профессиональных агентных сценариев - где ИИ не просто отвечает в чате, а делает работу: проходит многошаговый процесс, взаимодействует с окружением, доводит задачу до завершения.

На странице модели встречается обещание проектов длительностью больше десяти дней. Важно понимать статус этого тезиса: это заявление производителя, а устойчивых независимых демонстраций "марафона" на столь длинной дистанции пока не видно. То есть потенциал звучит интересно, но ждать подтверждения всё ещё приходится.

Независимые оценки: где сильнее, а где уступает

Artificial Analysis прогнала Qwen3.8 Max по своему набору тестов. В широком Intelligence Index модель набрала 58,1 балла. Claude Fable 5 в том же индексе получил 62,1. Июльная формулировка "сразу под Fable" выглядит довольно точной: разрыв около четырёх баллов.

Зато в Agentic Index картина меняется местами: Qwen3.8 Max получила 58,4, а Claude Fable 5 - 56,6. Выше Qwen на момент проверки оказались лишь два режима Claude Opus 5. Агентный индекс как раз про прикладные задачи "через инструменты": терминал, цепочки действий, управление шагами и доведение процесса до результата.

Отсюда простой практический вывод. Если вам важнее универсальная "умность" чат-бота в широком спектре задач, цифра Intelligence Index обычно весомее. Если же вы строите систему, которая должна ходить по инструментам, править файлы, поддерживать многошаговый workflow и не разваливаться по дороге, то преимущество в Agentic Index - веский повод дать Qwen отдельный пилот.

Отдельно стоит относиться к фирменным графикам самой Alibaba: производитель выбирает бенчмарки, режимы и соперников. Витринные результаты могут быть полезны как ориентир, но независимые измерения - более трезвая опора для решений.

Цена: тот самый "почти неприличный" прайс

Alibaba поставила единую ставку: $2 за миллион входных токенов и $6 за миллион выходных. Чтение закэшированного контекста - $0,25 за миллион токенов. На фоне Claude Fable 5 с официальными $10 за вход и $50 за выход это выглядит как другая лига: Qwen примерно в 5 раз дешевле по входу и примерно в 8,3 раза - по выходу.

Если взять агентный процесс, который за несколько часов "съел" 10 млн входных и 5 млн выходных токенов, то по базовым ставкам получится около $50 на Qwen3.8 Max и около $350 на Claude Fable 5 - разница семикратная. Кэширование, повторные вызовы и различная "глубина размышлений" изменят итоговую сумму, но порядок цифр понятен сразу.

Приятная деталь для тех, кто следит за линейкой: Qwen3.8 Max дешевле предыдущей Qwen3.7 Max. Раньше было $2,50 за вход и $7,50 за выход - новая флагманская модель получила скидку примерно на 20% ещё до того, как успела морально состариться.

"Дешёвый токен умеет размножаться": важная сноска про расход

У цены есть бухгалтерский нюанс, о который легко споткнуться в реальном использовании. На полном прогоне Intelligence Index модель выдала порядка 150 млн токенов, тогда как медиана сопоставимых моделей у Artificial Analysis - около 66 млн. Иными словами, Qwen может "разговаривать" и рассуждать более многословно, чем ожидается по рынку. При низкой цене за токен это не всегда больно, но в больших продакшен-процессах такой стиль генерации способен незаметно раздуть счёт и задержки.

Практическая рекомендация отсюда проста: заранее настраивайте лимиты, просите краткий формат, контролируйте необходимость "мышления" и используйте кэширование там, где контекст повторяется. Дешевизна токена не отменяет дисциплины, особенно когда модель склонна производить больше текста, чем её конкуренты.

Доступность: где уже можно использовать и что со скачиванием

API уже работает в QwenCloud - финальная версия стала коммерческим продуктом, которому можно выставлять счёт. При этом история с "открытыми весами" всё ещё в режиме ожидания: в июле они звучали как перспектива, и по состоянию на появление финального релиза "скачать и развернуть у себя" по-прежнему не является гарантированной опцией "здесь и сейчас". Если вам принципиален on-prem или полный контроль над инфраструктурой, это ограничение нужно учитывать заранее.

Кому уже стоит попробовать Qwen3.8 Max

Qwen3.8 Max особенно логично тестировать тем, кто:
1) строит агентные сценарии с инструментами и хочет получить максимум "действий за доллар";
2) упирается в контекст и устал от агрессивного чанкинга (длинные регламенты, юридические массивы, большие базы знаний, объёмная техдокументация);
3) считает стоимость выхода критичной (много отчётов, сводок, спецификаций, генерация структурированных артефактов);
4) ведёт параллельные эксперименты и хочет дешёвый, но сильный baseline уровня "рядом с топами", пусть и не номер один в общем интеллект-рейтинге.

Где всё ещё стоит быть осторожным

Если ваша задача - тонкая редактура, сложные рассуждения на грани "общей эрудиции" или вам важна максимальная стабильность качества на широком спектре интеллектуальных вопросов, разрыв в Intelligence Index в пользу Claude Fable 5 может проявиться в ежедневной работе. Ещё одна зона внимания - управляемость длины ответов и расход токенов: модель может быть настолько "щедрой", что начнёт ухудшать экономику процесса не ценой токена, а их количеством.

Наконец, мультимодальность (текст/изображения/видео) - сильная заявка, но её полезность всегда упирается в конкретные пайплайны: как вы извлекаете кадры, как описываете сцены, как фиксируете требования к формату ответа. Без дисциплины на входе "мультимодальность" превращается в красивое слово, а не в ускорение работы.

Что в итоге осталось от июльских обещаний

Ключевые обещания в сухом остатке в целом подтверждаются: модель действительно близка к Claude Fable 5 по независимому общему индексу и даже обходит его в агентном индексе; миллион токенов контекста заявлен как рабочая характеристика; цена оказалась не просто конкурентной, а почти демпинговой для флагмана такого класса. Но часть пунктов всё ещё "на доверии" - например, истории про сверхдолгие проекты и ожидание открытых весов.

Если вам нужна максимально выгодная по цене флагманская модель для инструментальных цепочек и длинного контекста - Qwen3.8 Max уже выглядит как кандидат на первый пилот. Если же вы выбираете "самую сильную в среднем по больнице" для чата и универсальных задач, имеет смысл сравнивать на своих данных и помнить, что в широком индексе лидерство остаётся за Claude Fable 5.

Прокрутить вверх