Sarvam AI 推出 Saaras V4:首款支持全印22种语言及全球英语的高效语音转写模型

在人工智能技术飞速发展的今天,多语言处理能力已成为衡量AI模型通用性与实用性的重要指标。近日,印度本土领先的AI初创公司Sarvam AI正式对外发布了其最新一代语音转文字(ASR)模型——Saaras V4。这款模型的最大亮点在于,它成功实现了对印度境内全部22种官方语言以及全球英语的全面覆盖,标志着印度在构建本土化、多语言语音AI生态方面迈出了关键一步。

从技术架构来看,Saaras V4采用了当前大模型领域备受关注的混合状态空间解码器架构,参数规模被控制在30亿级别。这种架构设计旨在平衡模型性能与计算效率,使得模型在保持高精度的同时,能够满足大规模部署的需求。模型由音频编码器与解码器两部分组成,通过高效的训练策略,大幅提升了在不同口音、方言以及复杂背景噪音环境下的识别准确率。与传统的基于Transformer的模型相比,混合状态空间模型在处理长序列音频数据时展现出更优的推理效率和更低的显存占用。

针对开发者与企业的实际应用需求,Saaras V4在功能层面进行了多项创新。其中最引人注目的是引入了“关键词提示”技术,用户可以在提示词中指定多达50个特定关键词,模型将优先处理并增强这些特定术语的识别权重。这一功能对于医疗、法律、金融等垂直领域的专业应用场景尤为关键,能够有效解决专业术语识别率低的问题。此外,Saaras V4支持5种不同的输出模式,从标准的全文转录到摘要生成、字幕提取、翻译等,极大地丰富了其应用场景,使其能够适配不同的业务流程。

在用户体验层面,Saaras V4实现了毫秒级的低延迟流式传输,首字输出时间被严格控制在150毫秒以内。这意味着用户在使用语音助手进行实时对话、进行会议记录或观看直播时,几乎感觉不到卡顿,体验接近原生应用。这种低延迟特性对于实时会议记录、在线直播字幕等对时效性要求极高的场景至关重要,能够确保信息的即时反馈。

在定价策略上,Sarvam AI展现了极具竞争力的优势。目前,Saaras V4通过Sarvam的API接口开放服务,定价仅为每小时30印度卢比(约合人民币2.7元)。这一极具性价比的价格,将显著降低企业和开发者接入多语言语音AI技术的门槛,有望加速印度本土语音应用的普及。相比之下,许多国际通用的语音识别服务价格高昂且往往偏向英语,Saaras V4的出现为印度市场提供了一个高性价比的替代方案。

总结而言,Saaras V4的发布不仅展示了Sarvam AI在语音识别技术上的深厚积累,更为印度庞大的多语言市场提供了一个强有力的技术底座。随着该模型的落地,印度有望在下一个AI应用浪潮中,摆脱对通用英语模型的依赖,构建起真正属于本土的多语言智能服务体系,推动AI技术在教育、公共服务等领域的深度渗透。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/26/sarvam-ai-releases-saaras-v4-a-speech-to-text-model-for-all-22-indian-languages-and-global-english/

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注