AMD выпустила открытую MoE-модель Instella-MoE-16B-A3B с 2,8 млрд активных параметров
AMD выпустила Instella-MoE-16B-A3B — полностью открытую языковую модель архитектуры Mixture-of-Experts, обученную с нуля на GPU Instinct MI300X и MI325X. Модель содержит 16 млрд параметров суммарно, но активирует лишь 2,8 млрд на каждый токен. AMD публикует веса со всех этапов обучения, а также смеси данных, конфигурации тренировки и код для инференса. Релиз выделяется двумя решениями системного уровня: Gated Multi-head Latent Attention (гейтируемое многоголовое латентное внимание) и связностью FarSkip-Collective.
Отчасти. Веса распространяются под лицензией ResearchRAIL, предназначенной только для академических и исследовательских целей, поэтому коммерческой моделью «из коробки» её назвать нельзя. При этом код обучения выпущен под лицензией MIT — и именно этот код является здесь более ценным переиспользуемым активом.
Instella-MoE — это декодер-only MoE с 27 слоями, скрытым размером 2048, 16 головками внимания и словарём на 128 896 токенов. Каждый MoE-слой использует 2 общих эксперта плюс 6 маршрутизируемых экспертов, выбираемых из 64. Это даёт 2,8 млрд активных параметров при 16 млрд суммарных. На этапах предобучения и промежуточного обучения применяется цель Multi-Token Prediction (предсказание нескольких токенов).
Стоит знать два важных структурных решения. Gated MLA добавляет лёгкий обучаемый выходной гейт к многоголовому латентному вниманию: отдельная линейная проекция вычисляет гейт, зависящий от входных данных, и применяет его мультипликативно перед выходной проекцией. FarSkip-Collective передаёт устаревшие и частичные активации в MoE- и attention-слои, перекрывая коммуникацию между экспертными параллельными процессами с вычислениями. AMD сообщает об ускорении предобучения на 12,7% и снижении времени до первого токена при обслуживании с экспертным параллелизмом до 39,2%.
Предобучение покрывает 7,1 трлн токенов из открытых корпусов, включая Nemotron-CC-v2, MegaMath, FineMath, RefineCode и TxT360. Промежуточное обучение использует Dolma3 Dolmino 100B в трёх вариантах данных, объединяемых усреднением весов. Отдельный этап длинного контекста расширяет окно с 4K до 64K токенов с помощью YaRN, увеличенной theta в RoPE и маскирования документов.
Постобучение включает SFT на Dolci-Think-SFT-7B плюс смеси Nemotron и завершается на управляемом обратной связью наборе из 512 тысяч примеров, нацеленном на выявленные слабые места. Далее следует DPO с обновлением смещений роутера и отключённой вспомогательной функцией потерь для балансировки нагрузки, чтобы избежать деградации. RL выполняется во фреймворке Miles: 1400 шагов RLVR для следования инструкциям, затем Multi-Teacher On-Policy Distillation, чтобы сохранить выигрыш без потери математических и кодовых навыков.
Базовый чекпойнт в среднем набирает 76,7 — это сильнейший результат среди полностью открытых моделей: впереди Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) и OLMoE-1B-7B (61,9). Он уступает лишь Qwen3.5-4B-Base (79,5). Лидирует на WinoGrande (86,5) и набирает 65,7 на HumanEval+. Средние по длинному контексту — 41,5 на HELMET и 79,4 на RULER.
Постобучение поднимает результат с SFT (71,58) до DPO (72,67) и Think (73,22) — выше Olmo3-7B-Think (71,97), Gemma-4-E4B think (70,47) и Qwen3.5-4B (69,73). IFEval растёт с 77,08 до 83,70.
Этот релиз показателен для всей индустрии: AMD демонстрирует, что современные эффективные MoE-модели можно обучать на открытом стеке и на собственном аппаратном обеспечении, публикуя при этом и веса, и код, и методику. Для исследователей такой уровень прозрачности означает возможность воспроизводить результаты и развивать модель дальше, а для рынка — рост конкуренции с закрытыми проприетарными системами.
По материалам MarkTechPost
