近日,Google 宣布了一项备受瞩目的测试计划:允许其 AI 助手 Gemini 代为拨打商业电话。这一功能标志着生成式人工智能(Generative AI)正在从单纯的对话工具向具备独立行动能力的智能代理(Agent)迈出关键一步。据悉,该功能将首先在美国地区向 Pixel 11 的所有者开放,且用户需订阅 Gemini Advanced 订阅服务才能体验。
从“对话”到“行动”的范式转变
长期以来,人工智能在语音交互领域主要扮演“听众”的角色,即通过语音合成(TTS)将文本转化为声音,或通过语音识别(ASR)理解人类指令。然而,Gemini 代打电话功能打破了这一界限,赋予了 AI 直接与第三方交互的权限。这意味着用户不再需要亲自拨打电话、排队等待或应对繁琐的客服流程,只需下达自然语言指令,AI 便能代表用户完成预订、咨询或取消服务等任务。
技术实现:语音克隆与意图理解
要实现逼真的代打电话,技术难度远超简单的文本生成。Google 需要解决的核心问题包括:如何让 AI 拥有逼真的声音?如何确保 AI 在通话中能理解对方的回复并做出恰当反应?据悉,该功能依赖于先进的语音克隆技术,使 Gemini 能够模拟特定声音,以通过电话那头商家的初步身份验证。同时,结合大语言模型(LLM)的强大推理能力,Gemini 能够理解复杂的商业术语,并在通话中保持礼貌、专业且具有说服力的语气。
应用场景与行业影响
这一功能的潜在应用场景极为广泛。想象一下,用户只需对手机说一句“帮我取消下周的餐厅预订,因为我要加班”,Gemini 就能自动拨通餐厅电话,与客服人员沟通并确认取消事宜,整个过程无需用户分心。在旅行预订、酒店入住、医疗预约等领域,这项技术将极大地节省用户时间,提升生活效率。
从行业角度来看,Google 的这一举措无疑将引发新一轮的 AI 代理竞争。此前,OpenAI 等公司也在探索类似的语音机器人技术。如果 Google 能够成功落地这一功能,将确立其在 AI 交互领域的领先地位,并推动整个科技行业向“自主智能代理”方向加速演进。
隐私与安全的挑战
尽管前景广阔,但 AI 代打电话也带来了不容忽视的隐私和安全风险。公众对于“Deepfake(深度伪造)”技术的担忧日益加剧,如果 AI 伪装成用户本人进行欺诈或恶意操作,将给用户和商家带来巨大困扰。Google 在测试阶段显然也意识到了这一点,因此将首批用户限定为 Pixel 11 的高价值用户,这既是为了控制风险,也是为了收集反馈以优化算法的安全性。
随着测试的逐步推进,Gemini 代打电话功能有望在不久的将来普及到更广泛的用户群体中。这不仅是一个技术演示,更是人工智能从“数字助手”进化为“生活管家”的重要里程碑,预示着未来人机交互将进入一个全新的智能化时代。
信息来源:AI News & Artificial Intelligence | TechCrunch,原文链接:https://techcrunch.com/2026/09/24/google-tests-letting-gemini-make-phone-calls-initially-for-us-pixel-owners/