微软发布MAI-Transcribe-2-Streaming:实时语音转文本新标杆,性能位列Artificial Analysis榜首

微软MAI-Transcribe-2-Streaming模型技术架构示意图

在人工智能技术日新月异的今天,语音识别作为人机交互的核心能力,其性能的每一次突破都备受业界关注。近日,微软AI宣布了一项里程碑式的技术成果——推出了业界首个实时语音转文本模型MAI-Transcribe-2-Streaming。该模型不仅在性能指标上创造了历史,更在公开的基准测试中取得了压倒性的胜利,为全球语音AI应用树立了新的标杆。

根据Artificial Analysis发布的最新基准测试数据,MAI-Transcribe-2-Streaming在38个参与竞评的模型中脱颖而出,以绝对优势占据了排行榜的首位。这一排名的含金量极高,因为它直接反映了模型在实际应用场景下的表现。特别是在“实时转录”这一细分领域,该模型展现了惊人的准确率和极低的延迟。数据显示,在生成最终转录文本时,其单词错误率(WER)仅为2.5%,处理延迟控制在0.13秒;而在生成首个部分转录时,其表现同样卓越,WER同样为2.5%,但处理速度更快,仅需0.12秒。

如此低的延迟意味着什么?在语音交互的实际场景中,0.13秒的延迟几乎可以忽略不计,用户几乎感觉不到文字生成的滞后。这种“零延迟”体验对于即时翻译、会议记录、实时字幕等应用至关重要。传统的语音识别往往存在一定的滞后,导致听感和阅读体验割裂,而MAI-Transcribe-2-Streaming的推出,有望彻底改变这一现状,实现真正的“所见即所得”或“所听即所得”。

除了卓越的性能,MAI-Transcribe-2-Streaming在多语言支持和适应性方面也表现出色。该模型支持60种语言的实时转录,并具备先进的持续语言检测(CLD)功能。这意味着,在一段包含多种语言混合的语音流中,模型能够精准地识别并自动切换识别目标语言,无需用户预先设定。这一特性极大地拓宽了该模型的应用边界,使其能够完美适应全球化背景下的跨国会议、国际商务沟通以及多语言直播等复杂场景。

对于开发者和企业用户而言,模型的可访问性和成本效益同样是考量的关键因素。MAI-Transcribe-2-Streaming目前正处于公测阶段,用户可以通过Microsoft Foundry平台访问该服务。在推广期内,该模型的每小时调用成本仅为0.54美元。这一极具竞争力的定价策略,极大地降低了企业接入先进语音AI技术的门槛,使得中小型开发者和初创公司也有机会利用顶级模型构建创新应用。

展望未来,MAI-Transcribe-2-Streaming的发布预示着企业级语音服务正在迈向更高的精度和更低的延迟。从远程办公中的实时会议辅助,到为听障人士提供无障碍的实时字幕服务,再到全球化的客户服务系统,该模型都有着广阔的应用前景。微软通过这一产品,再次巩固了其在AI基础设施领域的领导地位,也为整个行业树立了新的技术风向标。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/10/02/microsoft-ai-releases-mai-transcribe-2-streaming-1-real-time-speech-to-text-model-on-artificial-analysis/

封面图片来源:Unsplash / 摄影师 Steve A Johnson

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注