在人工智能技术飞速发展的今天,人机交互的方式正经历着一场深刻的变革。近日,NVIDIA 正式宣布推出其 NemotronLabs 团队开发的新一代开源模型——NemotronLabs VoiceChat 11B。这款模型的核心亮点在于其卓越的全双工语音转语音处理能力,将对话延迟压缩至约 450 毫秒,并支持实时工具调用,为构建更加自然、流畅的 AI 语音助手奠定了基础。
NVIDIA 一直以来都是 AI 基础设施领域的领跑者,而此次发布的 VoiceChat 11B 则标志着其在生成式语音领域的又一重要布局。不同于以往需要经过文本转语音(TTS)中间步骤的语音交互模式,NemotronLabs VoiceChat 11B 专注于端到端的语音转语音(S2S)生成。这意味着它能够直接从输入的音频流中理解含义,并即时生成自然的语音回复,无需显式的文本转换过程,极大地提高了交互的实时性和连贯性。
全双工(Full-Duplex)通信技术是此次发布的最大技术突破之一。在传统的语音交互中,往往存在明显的“等待-说话”循环,用户必须等待对方说完才能开始回应,这种模式在多人对话或快速信息交换时显得尤为笨拙。而 VoiceChat 11B 实现了真正的全双工能力,使得 AI 能够像人类一样进行“边说边听”。它能够在对方说话的间隙捕捉关键信息,并在不打断对方思维流的前提下,自然地插入回应。这种自然的“转场时间”(Turn-Taking)控制在 450 毫秒左右,这一数值非常接近人类大脑处理对话切换的认知阈值,从而让用户感觉不到明显的停顿或延迟。
除了低延迟和自然流畅的对话体验,NVIDIA 还在 VoiceChat 11B 中引入了“实时工具调用”的能力。这是迈向通用人工智能(AGI)的重要一步。在以往的语音模型中,模型通常只能进行对话,而无法执行具体的任务。VoiceChat 11B 则不同,它被设计为能够识别用户意图,并直接调用外部工具或 API 来执行操作。例如,当用户在语音中提出“订一张去北京的机票”时,模型不仅能听懂指令,还能实时调用订票系统的接口,获取结果后以语音形式反馈给用户。这种能力使得 AI 从单纯的对话者转变为能够辅助人类完成实际任务的智能助手。
值得一提的是,NVIDIA 选择将 NemotronLabs VoiceChat 11B 开源。这一举措对于开发者社区而言极具价值。作为一个拥有 110 亿参数(11B)的模型,它在性能与计算资源需求之间取得了良好的平衡。开源意味着全球的开发者可以基于此模型进行微调、定制化开发,从而加速各类垂直领域的语音应用落地,如智能客服、车载语音助手、实时翻译设备等。
从行业影响来看,NemotronLabs VoiceChat 11B 的发布进一步加剧了 AI 语音领域的竞争。它不仅展示了 NVIDIA 在模型架构上的深厚积累,也为业界提供了一个高水平的基准模型。随着该模型的普及,我们有望在未来看到更多具备类人对话能力和即时执行能力的智能产品涌现,彻底改变人们与数字世界交互的方式。
信息来源: MarkTechPost
原文链接: https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/