Cartesia 发布 Sonic-3.6:基于状态空间模型的流式语音合成新标杆

在人工智能技术飞速发展的今天,语音合成技术正逐步从“听得懂”向“听得像真人”以及“实时交互”跨越。近日,专注于流式 AI 模型的 Cartesia 官方宣布,其旗舰语音合成模型 Sonic 系列迎来了重大更新——Sonic-3.6 正式上线。这一模型不仅延续了前代的高性能,更在基于状态空间模型的状态下,取得了在 Artificial Analysis 两大语音排行榜上的双料第一,标志着流式 TTS 技术进入了新的竞技场。

Sonic-3.6 的最大亮点在于其架构设计。与目前主流的大型语言模型(如 GPT 系列)多采用 Transformer 架构不同,Sonic-3.6 构建于状态空间模型之上。这一技术选择具有深远的意义。Transformer 模型虽然强大,但在处理超长序列时面临着计算复杂度随序列长度呈二次方增长的问题,这对实时流式生成提出了巨大挑战。相比之下,基于状态空间模型的架构在处理长上下文时展现出线性复杂度的优势,这使得 Sonic-3.6 能够在保持高质量音质的同时,实现极低延迟的流式输出。

在性能评测方面,Sonic-3.6 的表现堪称统治级。根据 Artificial Analysis 提供的权威数据,Sonic-3.6 在 Provider Voice 排行榜上获得了 1,283 的 Elo 评分,并在 Controlled Voice 榜单上以 1,123 的分数傲视群雄。值得注意的是,Controlled Voice 榜单的设计非常严谨,它将所有参赛模型在相同的八个参考语音上进行克隆测试。这种“同台竞技”的方式有效地剥离了语音克隆器本身的干扰,纯粹评估合成引擎在声音控制、韵律和自然度上的真实能力。Sonic-3.6 能在这一榜单登顶,证明了其在声音韵律控制和情感表达上的卓越水准。

除了模型本身的架构优势,Sonic-3.6 的实用性也令人印象深刻。官方数据显示,该模型实现了低于 90 毫秒的时间首字生成时延。这意味着用户在输入文字的瞬间,几乎就能听到语音的开始,几乎没有“等待感”。这种极致的低延迟对于实时对话系统至关重要。想象一下,在未来的 AI 助手、实时翻译设备或沉浸式游戏 NPC 中,Sonic-3.6 能够让交互过程如同真人对话一般流畅自然,没有生硬的停顿或卡顿。

目前,Sonic-3.6 已在 Cartesia 的官方 API 上线 Beta 版本,开发者可以立即开始集成测试。这一开放姿态将加速该技术在各行各业的应用落地。从实时客服系统、智能车载助手到有声书制作,Sonic-3.6 都展现出了巨大的潜力。特别是对于需要处理大量语音数据的商业场景,基于 SSM 的架构有望在降低算力成本的同时,提供媲美甚至超越 Transformer 模型的音质体验。

总的来说,Sonic-3.6 的发布不仅是 Cartesia 技术实力的体现,也为 AI 语音合成领域提供了一个新的技术范式。它证明了状态空间模型在实时生成任务中的可行性,为打破当前语音合成的性能瓶颈提供了有力的解决方案。随着更多开发者加入这一生态,我们有理由相信,未来的 AI 交互将不再局限于文本,而是会以更加自然、流畅的声音形式,彻底改变人机沟通的方式。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/18/cartesia-ships-sonic-3-6-a-streaming-tts-model-that-now-leads-both-artificial-analysis-speech-arenas/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注