Модель NemotronLabs VoiceChat 11B объединяет распознавание, обработку и генерацию речи в единую сеть, обеспечивая задержку переключения речи 448 мс по тесту Full-Duplex-Bench 1.0. Она поддерживает live tool calling через отдельный канал с операторскими сообщениями во время выполнения API, но требует GPU с 80 GB VRAM и имеет статус исследовательской версии. Ограничения включают двухминутный контекст, риск деградации в бессмысленный текст и невозможность прерывания во время вызова инструментов.
NVIDIA рекомендует до пяти инструментов за сессию и отмечает, что модель занимает второе место среди открытых полнодуплексных моделей на VoiceBench и Full-Duplex-Bench 1.0. Веса и контейнер доступны открыто, но без размещенного API.