Nemotron 3 Ultra: флагманская открытая модель NVIDIA для агентного ИИ
Nemotron 3 Ultra — это флагманская открытая модель искусственного интеллекта от NVIDIA, выпущенная 4 июня 2026 года. Она представляет собой самую большую и мощную модель в семействе Nemotron 3, созданную специально для решения сложных, многошаговых задач в сфере агентного ИИ (Agentic AI).
Ключевые характеристики и архитектура
- Размер и архитектура. Модель использует архитектуру Mixture-of-Experts (MoE) и имеет 550 миллиардов параметров, из которых для обработки каждого токена активируется только 55 миллиардов. Это позволяет достигать высокой производительности при относительно низких вычислительных затратах. Для этого в ней используется гибридная архитектура Mamba-Transformer.
- Инновации в архитектуре. Модель включает несколько передовых технических решений:
- LatentMoE — улучшенный механизм маршрутизации между экспертами для повышения точности.
- Multi-Token Prediction (MTP) — возможность предсказывать несколько следующих токенов одновременно, что ускоряет генерацию и повышает её качество.
- Гибрид Mamba-Transformer — эффективно обрабатывает длинные контексты.
- Контекстное окно. Поддерживает контекст длиной до 1 миллиона токенов. Это позволяет модели обрабатывать и анализировать огромные объёмы информации, например, целые книги или большие базы кода.
- Режим работы. Является текстовой моделью (принимает и генерирует только текст). Поддерживает настраиваемый режим рассуждения (Reasoning Mode), который можно включать или отключать через шаблон чата.
- Языки. Поддерживает множество языков, включая английский, французский, испанский, немецкий, китайский, японский, корейский и другие.
Производительность и преимущества
- Скорость. Модель обеспечивает до 5 раз более высокую пропускную способность по сравнению с другими открытыми моделями аналогичного класса, что критически важно для длительных агентных рабочих процессов.
- Эффективность. Благодаря архитектуре MoE и квантизации NVFP4, Nemotron 3 Ultra позволяет снизить стоимость выполнения сложных агентных задач до 30%.
Целевые сценарии использования
Nemotron 3 Ultra создана для задач, требующих глубокого планирования и рассуждений. Основные применения включают:
- Оркестрация агентов. Координация работы нескольких подчинённых ИИ-агентов для выполнения сложных задач.
- Продвинутые агенты-кодеры. Генерация, тестирование и отладка кода в больших репозиториях.
- Глубокое исследование (Deep Research). Синтез информации из множества источников и поддержание связного рассуждения на протяжении длительного контекста.
- Сложные корпоративные рабочие процессы. Автоматизация многошаговых бизнес-процессов с принятием решений и обработкой ошибок.
- RAG высокого уровня. Высококачественная работа с системами Retrieval-Augmented Generation для работы с большими объёмами документов.
Доступность и лицензия
- Статус. Модель является открытой (open-weight). NVIDIA публикует не только веса, но и наборы данных для обучения и рецепты пост-тренировки.
- Доступ. Модель доступна для скачивания и использования через различные платформы, включая Hugging Face, NVIDIA NGC, Amazon SageMaker JumpStart, а также через API-провайдеров, таких как OpenRouter и Together AI.
- Лицензия. Распространяется под лицензией OpenMDW License Agreement, version 1.1.
Требования к оборудованию
Для запуска модели в полной точности (BF16) рекомендуются как минимум 16x H100 или 8x H200 GPU. Для работы с квантизированной версией (NVFP4) требования к оборудованию могут быть ниже.
