PolyAI 推出 Dialog-RSN-1:重新定义语音 AI 的音频原生对话模型

在人工智能与自然语言处理(NLP)快速发展的今天,语音交互技术依然是连接人类与数字世界的桥梁。PolyAI,这家在金融科技和呼叫中心自动化领域深耕多年的 AI 公司,近日宣布推出了一款具有里程碑意义的全新模型——Dialog-RSN-1。这款模型被定位为“音频原生”的对话模型,旨在彻底改变传统语音 AI 的处理范式,通过直接处理音频信号,大幅提升了对话的自然度和响应速度。

长期以来,大多数先进的语音助手都依赖于“语音转文字(ASR)- 大语言模型(LLM)- 文字转语音(TTS)”的流水线作业。虽然这种方法成熟,但它存在明显的局限性。首先,ASR 过程不可避免地会引入转录错误,这些错误会丢失原本音频中的韵律、语调和情感信息,导致 LLM 无法完全理解上下文。其次,这种多步骤的转换流程不仅增加了系统的复杂度,还显著提高了延迟,使得对话显得不够流畅。

Dialog-RSN-1 的核心创新在于其“音频原生”架构。与传统的先转录后处理不同,该模型能够直接感知并处理原始音频信号。这意味着模型在生成回复之前,就已经对说话者的声学特征、语义内容以及对话的上下文状态进行了深度理解。这种端到端的学习方式,使得模型能够更好地捕捉细微的语音线索,从而提供更加精准和富有同理心的回应。

值得注意的是,Dialog-RSN-1 并非一个简单的“黑盒”音频处理器,它实际上是一个高度集成的多模态系统。PolyAI 在该模型中成功融合了四个关键功能模块:轮次转换(Turn-Taking)、语音识别(Speech Recognition)、函数调用(Function Calling)以及回复生成(Response Generation)。这一融合极大地简化了系统的架构,使得各个模块能够协同工作,而不是像传统系统那样各自为战。

其中,“函数调用”功能的加入尤为关键。在传统的对话系统中,AI 往往只能进行“聊天”,而无法执行实际操作。Dialog-RSN-1 通过引入函数调用能力,使其具备了与外部世界交互的能力。例如,在客服场景中,AI 可以直接调用后台系统来查询订单状态、处理退款或更新客户信息,而不仅仅是生成一段描述这些操作的文本。这使得 AI 从单纯的“对话者”进化为具备执行力的“智能体”。

为了确保输出语音的高质量,PolyAI 采用了分离式的 TTS 设计。虽然模型内部处理音频,但在输出阶段,TTS 模块与主模型是解耦的。这种设计允许开发者和企业对最终的语音合成进行精细化的控制,确保输出的声音风格、语速和情感符合品牌调性,从而提供一致且优质的用户体验。

在部署模式上,Dialog-RSN-1 选择了基于请求的 LLM 运行方式,而非传统的“始终开启”的流式处理。这一策略在性能和资源消耗之间取得了良好的平衡。根据 PolyAI 的官方测试数据,在实时部署环境中,Dialog-RSN-1 能够在 300 毫秒以内生成响应。对于人类对话而言,300 毫秒的延迟几乎是不可感知的,这意味着该模型能够实现真正的“无感”实时交互,极大地提升了对话的沉浸感。

PolyAI 的这一发布,不仅展示了其在语音处理技术上的深厚积累,也为整个 AI 行业树立了新的标杆。随着 Dialog-RSN-1 的落地,我们有望看到呼叫中心、智能客服以及各类语音交互应用迎来一次质的飞跃。未来的语音 AI 将不再是机械的文字转述,而是具备深度理解、情感共鸣和执行能力的智能伙伴。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/30/polyai-releases-dialog-rsn-1-an-audio-native-dialog-model-that-fuses-turn-taking-speech-recognition-function-calling-and-response/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注