Qwen3.8-Max: Alibaba представила MoE-модель на 2,4 триллиона параметров — самую мощную в семействе Qwen
Китайская компания Alibaba официально представила Qwen3.8-Max — новую флагманскую модель семейства Qwen, построенную по архитектуре Mixture-of-Experts (MoE). С суммарным объёмом в 2,4 триллиона параметров она становится самой крупной и самой производительной моделью в линейке Qwen на сегодняшний день. При этом доступ к модели организован двумя путями: через размещённый API, который уже можно подключать компаниям любого размера, и через открытые веса, однако с открытыми весами всё не так просто.
Размещённый API разворачивается уже сегодня и совместим как с интерфейсом OpenAI, так и с экосистемой DashScope. Это означает, что для интеграции достаточно просто сменить базовый URL и идентификатор модели — весь остальной код остаётся без изменений. Такая совместимость существенно упрощает переход для разработчиков, которые уже работали с популярными облачными сервисами. Что касается открытых весов, то здесь ситуация принципиально иная: чекпоинт размером 2,4 триллиона параметров — это артефакт уровня многоузлового дата-центра, а не файл, который можно запустить на обычном сервере. Alibaba не раскрывает количество активных параметров, поэтому оценить стоимость инференса пока невозможно. Для тех, кто хочет запускать модель на собственном «железе» без облака, предназначена версия Qwen3.8-27B, которая помещается в стандартные GPU-серверы.
Опубликованный набор функций чётко ориентирован на четыре ключевые отрасли: разработку программного обеспечения, юридическую и финансовую проверку документов, медиа- и e-commerce-операции, а также дизайн. Это не случайный список — именно в этих сферах, по мнению разработчиков, мультимодальные и агентные возможности модели приносят максимальную практическую пользу бизнесу.
Среди заявленных применений — агенты для написания кода в масштабах целого репозитория, базы знаний по длинным документам, индексация длинных видео, извлечение структурированных данных и многошаговые исследовательские ассистенты. Другими словами, модель рассчитана на сложные задачи, где требуется одновременно удерживать в контексте огромные объёмы информации и выполнять последовательность действий.
Согласно странице модели, контекстное окно достигает 1 миллиона токенов. Максимальный размер входа составляет 991 тысячу токенов, а при включённом режиме «размышления» (thinking) он снижается до 983 тысяч. Максимальный выход — 131 тысяча токенов в обоих режимах, а максимальный бюджет на рассуждения — 262 тысячи токенов. Ограничения по скорости: 2 миллиона токенов в минуту и 15 тысяч запросов в минуту — этих показателей достаточно даже для интенсивной корпоративной нагрузки.
Цены установлены на уровне 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Чтение из неявного кэша стоит 0,25 доллара за миллион токенов, создание явного кэша — 2,5 доллара, а чтение из явного кэша — 0,17 доллара за миллион токенов. Кэшированный вход обходится в восемь раз дешевле свежего, поэтому стабильность префиксов запросов влияет на стоимость сильнее, чем длина промпта: приложениям с повторяющимися начальными фрагментами стоит оптимизировать именно эту часть.
Поддерживаемые возможности включают вызов функций, структурированные выходные данные, пакетную обработку, завершение префиксов и дообучение. В составе Responses API поставляются пять встроенных инструментов: code_interpreter для исполнения кода, web_search для поиска в интернете, web_extractor для извлечения содержимого страниц, t2i_search и i2i_search для поиска по тексту и изображениям.
Вместе с релизом Alibaba опубликовала полную таблицу бенчмарков. Qwen3.8-Max набирает 86,6 балла в Terminal-Bench 2.1, опережая Claude Opus 4.8 и Claude Fable 5 с их 84,6, но уступая GPT-5.6 Sol (max), у которого 88,8. На SWE-bench Pro модель показывает 67,7 против 80,0 у Fable 5, а на FrontierSWE — 73,5 против 88,8. Зато в PaperBench она лидирует с результатом 93,0, а в IFBench — 82,8. В GPQA Diamond модель набирает 92,6 — лишь немного выше, чем 92,4 у Qwen3.7-Max. Самые заметные улучшения касаются мультимодальности и агентных способностей, а не чистых рассуждений: она возглавляет большинство «зрительных» дисциплин, включая OSWorld-Verified (86,1), Parametric CAD Bench (91,5) и OmniDocBench 1.5 (92,1). По сравнению с собственной предшественницей прогресс огромный: DeepSWE 1.1 вырос с 21,6 до 56,6, FrontierSWE — с 40,7 до 73,5, JobBench — с 31,3 до 53,4. Впрочем, честный анализ требует двух оговорок. Во-первых, мультимодальная таблица сравнивает модель с Qwen3.7-Plus, а не с Qwen3.7-Max, что льстит разнице поколений. Во-вторых, собственная кривая масштабирования RL у Alibaba достигает пика 0,725 примерно на 4 тысячах обучающих сред, а затем снижается до 0,719 и 0,689.
По материалам MarkTechPost
