在语音合成(Text-to-Speech, 简称 TTS)领域,长期以来存在一个“不可能三角”:即如何同时实现极高的语音生成速度、极高的自然度以及极低的延迟。近日,AI 创业公司 Gradium AI 正式推出了其新的默认 TTS 模型,并宣布在打破这一技术瓶颈上取得了里程碑式的进展。该模型在 Coval 平台上表现出色,不仅将首音生成时间(Time-to-First-Audio)压缩至仅 216 毫秒(P50 指标),更在 500 个跨语言“难句”测试中取得了 81.0% 的人类评分通过率。
Gradium AI 的此次更新意味着,用户在使用其服务时,几乎可以感知不到延迟。216 毫秒的响应速度对于实时交互场景至关重要,它标志着 TTS 技术已经从“离线合成”向“实时流式生成”迈出了坚实的一步。以往,为了追求声音的自然拟人化,模型往往需要较长的计算时间,导致语音输出存在明显的卡顿感。而 Gradium 的新模型成功平衡了这一矛盾,在保持语音听起来像真人朗读的同时,极大地提高了响应效率。
为了验证模型的性能,Gradium AI 采用了极为严苛的测试标准。他们构建了一个包含 500 个“难句”的评估数据集,覆盖了五种不同的语言。这里的“难句”并非简单的长难句,而是包含了多种复杂的语音特征、语法结构以及情感表达需求。能够在这类高难度的测试集上获得 81.0% 的人类评分通过率,表明该模型在处理复杂语音时依然保持了极高的稳定性和准确度,能够有效避免机械音或含糊不清的发音问题。
此外,Gradium AI 展现了开放共享的科研精神。他们将这套评估数据集上传至 Hugging Face 平台,并采用 CC BY 4.0 协议开源。这一举措为全球的开发者、研究人员和爱好者提供了一个宝贵的资源,允许社区复现测试结果、进一步微调模型参数或探索新的应用场景。开源数据集的使用是推动 AI 技术民主化的重要手段,有助于加速 TTS 技术的迭代与创新。
从行业应用角度来看,这一新模型的问世将极大地拓展 TTS 技术的落地边界。在元宇宙和虚拟现实(VR/AR)领域,低延迟的语音合成是实现沉浸式体验的关键,Gradium 的技术使得虚拟角色的对话更加流畅自然。在智能客服和陪伴型 AI 助手中,快速的语音响应能显著提升用户的满意度和留存率。同时,对于有声书制作、新闻播报以及无障碍辅助技术而言,高质量的语音输出将极大地降低内容生产成本,提高信息的传播效率。
总而言之,Gradium AI 的新 TTS 模型通过技术创新,重新定义了“实时语音合成”的性能标准。它不仅展示了当前 AI 在语音处理领域的前沿水平,也为未来的智能交互界面提供了强有力的技术支撑。随着该模型的开源,我们有理由相信,更多基于此技术的创新应用将涌现出来,进一步改变我们与数字世界的交互方式。
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/31/gradium-ai-releases-new-default-tts-model-81-0-hard-case-pass-rate-at-216-ms-time-to-first-audio/