在人工智能技术飞速发展的今天,Google 似乎正致力于将 Gemini 大语言模型的能力从单纯的文本生成和图片创作,进一步延伸至更贴近生活的语音交互领域。据科技媒体 Android Authority 报道,谷歌正在测试一项名为“Gemini Calling”的新功能,这可能标志着 Google 现有的“Call for Me”商务通话代打服务,将正式向普通用户的日常生活场景开放。
此前,Google 的“Call for Me”功能主要面向商务人士,允许用户设置特定的通话脚本,由 AI 代理拨打电话并传达预设的信息,例如预约诊所、联系办公室行政人员或询问外卖配送状态等。这种 B2B(企业对商业)的初步尝试,展示了 AI 在处理电话沟通这一复杂任务上的潜力。然而,最新的代码分析显示,谷歌的野心显然不止于此。
在针对 Android 系统的 APK(应用安装包)进行逆向工程分析时,开发者发现了名为“Gemini Calling”的全新界面入口。与以往仅限于商务场景的“Call for Me”不同,新的界面中出现了诸如“Call Mom and tell her I will be 15 minutes late”(给妈妈打电话告诉她我会晚到 15 分钟)这样的示例。这一细节强烈暗示,Google 正在构建一个能够处理更自然、更情感化以及更非结构化对话的 AI 语音代理。
这一潜在功能的扩展,对于智能手机用户而言具有深远的意义。首先,它极大地提升了沟通效率。对于处于高强度工作状态、无法即时接听电话的专业人士来说,能够授权 AI 助手以自己的口吻向亲友传达迟到或不在场的信息,将大幅减少沟通摩擦。其次,对于老年群体或语言障碍者,AI 语音代理或许能成为跨越数字鸿沟的桥梁,帮助他们更轻松地与家人保持联系。
从技术层面来看,实现从“商务脚本化通话”到“亲友自然对话”的转变是巨大的挑战。在商务场景中,对话通常是单轮的或流程固定的;而在亲友通话中,对方可能会反问“你在哪?”、“晚到没关系”等个性化问题,甚至可能开启一段闲聊。要实现“Gemini Calling”,Google 的 AI 模型不仅需要具备极高的语音合成(TTS)自然度,还需要拥有强大的实时语音识别(ASR)和上下文理解能力,以便在电话接通后,根据对方的反馈灵活调整对话策略。
当然,这一功能的推出也伴随着隐私和伦理方面的考量。用户将语音信息授权给 AI 处理,本质上是在让渡一部分隐私权。此外,如果 AI 在传达信息时出现误解,或者未能妥善处理突发状况,可能会引发不必要的误会。因此,Google 在正式发布这一功能前,很可能需要在用户界面中增加更精细的权限控制和对话记录审查机制。
随着 Google 不断深化其在 AI 语音领域的布局,我们可以预见,未来的手机将不再仅仅是通讯工具,而是具备高度智能的私人助理。无论是处理繁琐的行政事务,还是维系亲密的人际关系,AI 都有潜力成为人类最得力的助手。虽然目前“Gemini Calling”仍处于测试阶段,但这一动向无疑为用户描绘了一幅更加便捷、智能的未来生活图景。
信息来源: The Verge
原文链接
信息来源:The Verge,原文链接:https://www.theverge.com/ai-artificial-intelligence/1005177/google-gemini-call-for-me-expansion-rumors
封面图片来源:Unsplash / 摄影师 Brett Jordan
