NVIDIA представила открытую речевую модель NemotronLabs VoiceChat 11B — голосовые ассистенты нового поколения
NVIDIA представила открытую речевую модель NemotronLabs VoiceChat 11B — компактную full-duplex модель класса «речь-в-речь» (speech-to-speech), которая способна одновременно слушать пользователя и говорить, обеспечивая естественный диалог без заметных задержек. Модель уже доступна для тестирования пилотами, но, по заявлению самой компании, пока не предназначена для продакшн-нагрузок: веса и контейнер опубликованы, лицензия разрешительная, однако NVIDIA подчёркивает, что контрольная точка «готова только для исследовательских целей». В репозитории честно перечислены реальные ограничения: потолок аудиоконтекста в две минуты, деградация до невосстановимой «абракадабры» после нескольких раундов диалога, самопроизвольный «разговор с самим собой» после завершения реплики, а также пропуск слов в распознавании речи пользователя.
Архитектура и данные обучения
Архитектурно модель представляет собой гибрид Mamba/Transformer, собранный из трёх существующих компонентов NVIDIA и одного нового выходного тракта. На выходе модель выдаёт аудио агента, текстовую реплику агента и текущую транскрипцию речи пользователя. Обучение велось примерно на 550 тысячах часов аудио, включая реальные и синтетические корпуса, на основе технологий SALM-Duplex и Audio Flamingo 3. Такой объём данных позволяет модели уверенно работать в режиме полного дуплекса, который раньше был прерогативой крупных закрытых систем.
Вызов инструментов и ограничения
Ключевая особенность — поддержка вызова инструментов на боковом канале: модель генерирует блок
Результаты тестов
По бенчмаркам модель показывает достойные результаты: на Full-Duplex-Bench 1.0 плавный обмен репликами (TOR) достигает 0,82 при задержке 448 мс, прерывание пользователем — TOR 1,00 при 480 мс, а обработка пауз — 0,153 на синтетических данных и 0,255 на корпусе Candor (где меньше — лучше). В тесте голосового вызова инструментов AU Harness BFCL-v3 модель получила 58,5% на простых вызовах, 62,5% на множественных, 42,5% на параллельных, 27,5% на параллельно-множественных, 89,6% на нерелевантности и 56,1% в среднем. На Full-Duplex-Bench v3 точность выбора инструмента составила 82,5%, точность аргументов — 44,2%, а pass@1 — 33%. По заявлению NVIDIA, модель занимает второе место среди открытых full-duplex моделей на VoiceBench и второе место среди открытых моделей на Full-Duplex-Bench 1.0.
Что дальше
Релиз — важная веха для экосистемы открытого ИИ: открытая модель с полнодуплексным голосовым диалогом и поддержкой вызова инструментов открывает путь к созданию голосовых ассистентов нового поколения силами небольших команд. Разработчики могут взять модель с Hugging Face, изучить примеры в репозитории NeMo Speech и запустить её через NGC-контейнер. Дальнейшие итерации, вероятно, закроют отмеченные ограничения — прежде всего потолок аудиоконтекста и устойчивость к длинным диалогам, — и тогда модель сможет претендовать на продакшн-использование в колл-центрах, голосовых помощниках и умных устройствах.
По материалам MarkTechPost
