NVIDIA выпустил Nemotron 3.5 Lightning: открытую MoE-модель 30B с 3B активными параметрами и NeMo Switch
NVIDIA представила открытые технологии для построения постоянно работающих ИИ-агентов на основе систем специализированных моделей. Вместе вышли два артефакта: Nemotron 3.5 Lightning — лёгкая кастомизируемая открытая модель для высоконагруженных агентных задач, и NeMo Switchyard — открытая библиотека маршрутизации, которая направляет каждый шаг рабочего процесса агента на наиболее подходящую и эффективную модель. Оба инструмента решают структурную проблему: длительные агенты тратят большую часть времени на вызовы инструментов, проверку результатов и делегирование подзадач подчиненным агентам, а отправка каждого из этих шагов на передовую модель рассуждений увеличивает стоимость и задержку.
Nemotron 3.5 Lightning — это 30-миллиардная модель смеси экспертов (MoE) с 3 млрд активными параметрами, построенная на гибридной архитектуре Mamba-2 + MoE + Attention с контекстным окном в 1 млн токенов. NVIDIA сообщает о скорости генерации в 4 раза выше, чем у моделей сопоставимого размера, а также о выполнении 10 тыс. задач PinchBench на 30% быстрее, чем Qwen3.6 35B при сопоставимой точности. Многие отраслевые игроки, включая CrowdStrike, Harvey, CodeRabbit, Fastino Labs и Lila Sciences, уже кастомизируют модель для задач кибербезопасности, юридической работы, программирования, финансов и здравоохранения.
Модель готова к коммерческому использованию под лицензией OpenMDW-1.1 с открытыми весами, данными для обучения и рецептами. Развёртывание возможно даже на одном современном графическом процессоре: NVIDIA указывает запуск на 1x DGX Spark (GB10) или 1x H100, что выравнивает возможности одиночных разработчиков и стартапов на ранней стадии с крупными предприятиями. Команды среднего сегмента могут использовать модели через облачные сервисы Baseten, Together AI или Nebius, а регулируемые предприятия могут разворачивать её полностью на собственной инфраструктуре.
Целевые отрасли: кибербезопасность, юридические услуги, программная инженерия, финансовые услуги, здравоохранение и науки о жизни. Основные сценарии использования: вызов инструментов, проверка результатов, делегирование подзадачам подчиненным агентам, маршрутизация при ревью кода, сортировка логов, парсинг контрактов и длинный контекстный поиск информации в окне до 1 млн токенов.
Длинные агенты тратят большую часть времени на выполнение операций: вызовы инструментов, проверку результатов и делегирование задач. Отправка каждого такого шага на передовую модель рассуждений увеличивает стоимость и задержку. Nemotron 3.5 Lightning нацелена именно на этот исполнительский слой. Это 30-миллиардная MoE-модель с 3 млрд активными параметрами на гибридной архитектуре Mamba-2 + MoE + Attention с контекстом до 1 млн токенов. Предобучение проводилось на более чем 20 трлн токенов с использованием NVFP4-рецепта. Модель является самой маленькой в семействе Nemotron 3: передовые модели, такие как Nemotron 3 Ultra, отвечают за orcheстцию и планирование, а Lightning обрабатывает рутинные вызовы под ними.
Высокая скорость обеспечивается двумя механизмами. Во-первых, спекулятивное декодирование: многотокенное предсказание было интегрировано на этапе отдельного предобучения, а затем улучшено на этапе MTP-boosting. NVIDIA также поставляет два внешних черновых модели: DSparks — полуавторегрессивный драфтер, рекомендованный для DGX Spark и низкоконкурентных дата-центров, и DFlash, использующий лёгкую блок-диффузную модель. Во-вторых, квантизация: вместе с чекпоинтом BF16 поставляется NVFP4-версия, которая нативно работает на архитектурах Blackwell и Hopper, а через ядра W4A16 поддерживает и Ampere. NVIDIA сообщает о скорости генерации в 4 раза выше, чем у моделей сопоставимого размера, а на PinchBench модель показывает 86% точности, выполняя 10 тыс. задач на 30% быстрее Qwen3.6 35B при сопоставимой точности.
Опубликованные в карточке модели результаты (BF16 / NVFP4): MMLU Pro 81,94 / 81,62, GPQA Diamond 75,44 / 75,57, SWE-bench Verified 51,56 / 52,80, Terminal-Bench 2.1 24,58 / 23,46, AA-LCR 52,00 / 49,19. Рекомендуемые параметры сэмплирования: температура 1,0 и top_p 0,95.
NeMo Switchyard — это открытая библиотека, которая направляет каждый шаг рабочего процесса агента на наиболее способную и эффективную модель. В ней доступны настраиваемые маршрутизаторы: классификатор LLM с привязкой к сессии, пошаговый маршрутизатор, который анализирует последнюю активность по вызовам инструментов, и маршрутизатор эскалации, который начинается с дешёвой модели и переключается на более мощную при стабильно высокой сложности задачи. Также есть настраиваемый префил-маршрутизатор, который обучается на остаточном потоке модели, предсказывая, какой кандидат справится с задачей лучше. Эталонный сервер принимает запросы по API OpenAI, Anthropic и Responses.
Два опубликованных результата: при бенчмаркинге 145 многоходовых агентных задач в LangChain маршрутизация между Lightning и Claude Opus 4.8 с использованием маршрутизатора эскалации снизила стоимость на 74% по сравнению с базовым вариантом только на передовой модели, направив только 7% вызовов на мощную модель с потерей точности около 6 пунктов. Cognition реализовала пошаговую маршрутизацию в Devin Desktop: на FrontierCode Main при маршрутизации между Opus 5 и Kimi K2.7 результат составил 50,6% при средней стоимости $3,11, что всего на 2,8 пункта ниже точности Opus 5, но на ~28% дешевле по средней стоимости.
Ключевые выводы:
- 30-миллиардная открытая MoE-модель с 3 млрд активными параметрами, контекст в 1 млн токенов, лицензия OpenMDW-1.1, разрешающая коммерческое использование.
- Скорость генерации выше в 4 раза; 10 тыс. задач PinchBench выполняются на 30% быстрее, чем у Qwen3.6 35B.
- Скорость обеспечивается за счёт многотокенного предсказания и черновых моделей DSparks и DFlash, а также наличия чекпоинта NVFP4.
- Запуск возможен на 1x DGX Spark или 1x H100, а также локально через Ollama, LM Studio, llama.cpp и Unsloth.
- NeMo Switchyard снизил стоимость на 74% в бенчмарке LangChain из 145 задач с потерей точности около 6 пунктов.
Попробовать модель можно на build.nvidia.com или OpenRouter, а скачать веса — с Hugging Face или ModelScope.
По материалам MarkTechPost
