25.08.2026

NVIDIA представила открытую речевую модель NemotronLabs VoiceChat 11B — голосовые ассистенты нового поколения

img2

NVIDIA представила открытую речевую модель NemotronLabs VoiceChat 11B — компактную full-duplex модель класса «речь-в-речь» (speech-to-speech), которая способна одновременно слушать пользователя и говорить, обеспечивая естественный диалог без заметных задержек. Модель уже доступна для тестирования пилотами, но, по заявлению самой компании, пока не предназначена для продакшн-нагрузок: веса и контейнер опубликованы, лицензия разрешительная, однако NVIDIA подчёркивает, что контрольная точка «готова только для исследовательских целей». В репозитории честно перечислены реальные ограничения: потолок аудиоконтекста в две минуты, деградация до невосстановимой «абракадабры» после нескольких раундов диалога, самопроизвольный «разговор с самим собой» после завершения реплики, а также пропуск слов в распознавании речи пользователя.

Архитектура и данные обучения

Архитектурно модель представляет собой гибрид Mamba/Transformer, собранный из трёх существующих компонентов NVIDIA и одного нового выходного тракта. На выходе модель выдаёт аудио агента, текстовую реплику агента и текущую транскрипцию речи пользователя. Обучение велось примерно на 550 тысячах часов аудио, включая реальные и синтетические корпуса, на основе технологий SALM-Duplex и Audio Flamingo 3. Такой объём данных позволяет модели уверенно работать в режиме полного дуплекса, который раньше был прерогативой крупных закрытых систем.

Вызов инструментов и ограничения

Ключевая особенность — поддержка вызова инструментов на боковом канале: модель генерирует блок , а код разработчика возвращает результат в блоке . Особого внимания заслуживает механизм «фразы на удержании» (on-hold message): для каждого инструмента оператор заранее задаёт реплику, которую агент произносит в момент генерации текста, запускающего вызов, — благодаря этому диалог не зависает в тишине, пока выполняется внешний API-запрос. Ограничения при этом явные и задокументированные: рекомендуется не более пяти инструментов на сессию, модель не умеет надёжно вызывать несколько инструментов одновременно, а пользователь не может прервать агента во время выполнения инструмента. Кроме того, системные промпты и ответы инструментов должны быть только в ASCII и пригодны для синтеза речи.

Результаты тестов

По бенчмаркам модель показывает достойные результаты: на Full-Duplex-Bench 1.0 плавный обмен репликами (TOR) достигает 0,82 при задержке 448 мс, прерывание пользователем — TOR 1,00 при 480 мс, а обработка пауз — 0,153 на синтетических данных и 0,255 на корпусе Candor (где меньше — лучше). В тесте голосового вызова инструментов AU Harness BFCL-v3 модель получила 58,5% на простых вызовах, 62,5% на множественных, 42,5% на параллельных, 27,5% на параллельно-множественных, 89,6% на нерелевантности и 56,1% в среднем. На Full-Duplex-Bench v3 точность выбора инструмента составила 82,5%, точность аргументов — 44,2%, а pass@1 — 33%. По заявлению NVIDIA, модель занимает второе место среди открытых full-duplex моделей на VoiceBench и второе место среди открытых моделей на Full-Duplex-Bench 1.0.

Что дальше

Релиз — важная веха для экосистемы открытого ИИ: открытая модель с полнодуплексным голосовым диалогом и поддержкой вызова инструментов открывает путь к созданию голосовых ассистентов нового поколения силами небольших команд. Разработчики могут взять модель с Hugging Face, изучить примеры в репозитории NeMo Speech и запустить её через NGC-контейнер. Дальнейшие итерации, вероятно, закроют отмеченные ограничения — прежде всего потолок аудиоконтекста и устойчивость к длинным диалогам, — и тогда модель сможет претендовать на продакшн-использование в колл-центрах, голосовых помощниках и умных устройствах.

По материалам MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *