25.08.2026

Muse Glimmer от Meta: агентная ИИ-модель на 30 млрд параметров, которая запускается на одной потребительской видеокарте

featured_2-1

Meta выпустила Muse Glimmer — мультимодальную модель на 30 миллиардов параметров, дистиллированную из более крупной Muse Spark. Модель заточена под постоянно работающие локальные агентные сценарии и распространяется под лицензией Apache 2.0. Обычно 30B-модели требуют более 55 ГБ памяти в полной точности, но Meta сжимает веса примерно до 4 бит и добавляет блочное спекулятивное декодирование — так модель отвечает достаточно быстро, чтобы встроиться в реальный агентный цикл. Итог: запуск на одной потребительской видеокарте или на Mac, без единого сетевого вызова.

Готовность к развёртыванию

Да, веса открыты под Apache 2.0. В коллекции Hugging Face доступны веса BF16, GGUF-кванты, сборки ExecuTorch и дравтер DFlash. Локальный хостинг — это путь «с первого дня». Сольные разработчики и стартапы запускают модель на одной GPU объёмом 24 ГБ или на Mac с M4/M5 Max; команды среднего размера получают инференс в своём контуре без платы за каждый токен; регулируемые предприятия — агента, который можно полностью изолировать от сети. Meta советует добавлять системные предохранители на уровне платформы, а не публиковать модель как голую конечную точку API.

Ключевые отрасли — здравоохранение, юриспруденция, финансовые услуги, оборона и госсектор, производство и сервис на местах: именно там требования к хранению данных, офлайн-режиму или задержкам исключают облачный вызов. Среди приложений — десктопные агенты, читающие скриншоты, агенты для программирования и вызов функций по схеме, а также анализ документов и диаграмм, генерация синтетических данных и оценка «LLM-как-судья».

Архитектура и обучение

Muse Glimmer — это плотный каузальный трансформер с отдельным перцептивным энкодером. Суммарно в модели около 30 млрд параметров, включая зрительную часть. В grouped-query attention используются 32 головы запроса и 2 головы KV. Внимание повторяет паттерн Local, Local, Local, Global с окном скольжения 2048; RoPE применяется только к локальным слоям с тета 500 000. Зрительная сторона — перцептивный энкодер ViT-G/14 на ~1,8 млрд параметров, принимающий до 4 096 визуальных токенов на изображение. Длина контекста — 131 072+ токенов, словарь — 202 048 токенов, точка отсечения знаний — 4 января 2026 года. Вход — текст и изображение, выход — текст. Аудио не поддерживается, видео обрабатывается как отдельные кадры.

Обучение шло в три фазы: на предобучении использовалась дистилляция логитов на выходах Muse Spark; на промежуточном этапе добавили данные с длинным контекстом и насыщенные «агентные» данные с трассами рассуждений; на пост-обучении объединили обучение с учителем, дистилляцию с наградой и обучение с подкреплением по общим, рассуждающим, кодовым и агентным доменам.

Как 30B помещается в потребительское железо

В полной точности модель требует более 55 ГБ памяти. Meta сжимает веса примерно до 4 бит, и языковая модель занимает менее 20 ГБ — остаётся запас внутри рамок 24 или 32 ГБ, который делят KV-кэш, перцептивный энкодер и дравтер. Выпускается две квантованные сборки: K-Quant-Dynamic целится в 32 ГБ VRAM с деградацией 0,2%, K-Quant-17GB — в 24 ГБ VRAM с деградацией 1,0% (усреднение по метрикам точности на 15 распространённых бенчмарках).

Скорость генерации обеспечивает DFlash — блок-диффузионный дравтер, предсказывающий 16 токенов за один прямой проход, пока основная модель параллельно верифицирует блок. Измерения Meta для K-Quant-17GB (batch size 1, жадное декодирование): на RTX 5090 пропускная способность растёт с 74,9 до 233,4 ток/с — ускорение в 3,1 раза; Apple M5 Max — с 26,6 до 50,2 ток/с.

Бенчмарки и безопасность

Meta сравнивает Muse Glimmer с Gemma4-31B и Qwen3.6-27B в режиме рассуждений. Модель лидирует в MCP Atlas (75,5 против 54,2 и 62,5), в DeepSearch QA (74,6), Gaia2 (43,3) и SWE-Bench Pro (51,2). Результаты рассуждений: AIME 2026 — 94,7, IFBench — 77,0, AA-LCR — 80,0. Qwen3.6-27B остаётся впереди в OSWorld-Verified (75,6 против 65,9), TerminalBench 2.1 (60,7 против 48,6) и SWE-Bench Verified. Закономерность последовательная: Muse Glimmer выигрывает в агентной оркестрации и рассуждениях, но уступает в работе с компьютером и терминалом.

По безопасности, уровень успешных атак Siren AgentDojo — 28,4 при полезности 94,2. Meta заявляет, что модель не подпадает под определение Frontier AI в своей расширенной системе оценки. Риски «хим/био», «кибер» и «потеря контроля» оцениваются как умеренные или ниже. Для команд, которым нужен локальный агентный ИИ без утечек данных, Muse Glimmer выглядит одним из самых сбалансированных открытых предложений сезона: открытые веса, честные цифры производительности и понятное ограничение — за пределами компьютерного контура её мощь ещё предстоит наращивать.

По материалам MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *