OpenAI 扩展语音模式至桌面版 ChatGPT,Work 与 Codex 模型全面接入

OpenAI ChatGPT Desktop Application with Voice Feature Interface

北京时间 2026 年 7 月 25 日消息,OpenAI 宣布其备受期待的桌面版 ChatGPT 应用现已正式支持语音模式。这一更新标志着 OpenAI 在多模态交互领域的又一重要里程碑,用户现在可以通过语音指令直接与 ChatGPT 的专业工作流模型及代码生成模型进行交互,从而实现更复杂的任务控制与自动化操作。

长期以来,语音交互一直是 ChatGPT 在移动端的一大亮点,允许用户通过语音与 AI 进行自然的对话。然而,对于习惯使用键盘的高频生产力用户和开发者而言,桌面端的缺失一直是一个遗憾。此次更新不仅填补了这一空白,更通过引入与“ChatGPT Work”和“Codex”模型的深度集成,将语音功能从简单的问答工具升级为全能的智能代理。

从问答到控制:语音模式的深度进化

此次桌面版语音模式的核心升级在于其“控制能力”。在传统的文本交互中,用户需要输入具体的指令来完成任务。而在新的语音模式下,用户只需通过口语下达命令,系统便能自动调用相应的底层模型来完成工作。

具体而言,当用户在桌面端激活语音模式并要求执行复杂任务时,ChatGPT 可以智能判断并调用“ChatGPT Work”模型来处理涉及数据分析、文档撰写或日程管理的专业工作流;若用户提出编程需求,系统则会无缝切换至“Codex”模型。这种“听声辨位”并自动匹配最佳模型的机制,极大地降低了人机交互的门槛,让语音成为连接用户意图与 AI 能力的桥梁。

重塑开发者与职场人士的工作流

对于开发者群体而言,桌面版语音模式与 Codex 的结合具有革命性的意义。长期以来,编写代码主要依赖于键盘输入。虽然 AI 编程助手已经普及,但如何高效地指挥 AI 进行大规模代码重构或调试仍是一个挑战。通过语音模式,开发者现在可以在进行多任务处理时,通过语音快速生成代码片段、解释复杂的代码逻辑或进行调试,从而显著提升编码效率。

对于职场人士,ChatGPT Work 模型的接入则意味着“语音办公”时代的到来。用户不再需要将注意力集中在屏幕上打字,只需通过语音指令,即可让 AI 帮助整理会议纪要、生成营销文案或处理繁琐的行政任务。这种“边说边做”的模式,将人从机械性的输入工作中解放出来,能够更专注于决策与创意本身。

行业影响:多模态交互成为主流趋势

OpenAI 在桌面端推出语音模式,不仅是对移动端功能的补全,更是对行业交互范式的一次引导。随着生成式 AI 技术的成熟,单纯的文本交互已无法满足用户对效率和自然感的需求。语音作为人类最本能的沟通方式,正逐渐成为 AI 的核心交互界面。

这一更新也预示着 AI 代理(Agent)概念的落地。未来的 AI 不再是被动的回答者,而是能够通过语音主动理解并执行任务的主动执行者。OpenAI 通过将语音模式与 Work 和 Codex 结合,实际上是在构建一个能够理解人类意图、并调用专业工具解决问题的“数字劳动力”。

综上所述,桌面版 ChatGPT 语音模式的上线,不仅提升了用户体验的连贯性,更通过深度模型集成,将 AI 的能力边界从“对话”推向了“执行”。随着多模态交互技术的不断成熟,我们预计未来将有更多类似的功能涌现,彻底改变我们与数字世界的交互方式。

信息来源:AI News & Artificial Intelligence | TechCrunch,原文链接:https://techcrunch.com/2026/07/24/openais-new-voice-mode-makes-it-to-the-chatgpt-desktop-app/

封面图片来源:Unsplash / 摄影师 Rolf van Root

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注