ITCOW牛新网 8月9日消息,OpenAI 日前宣布为 ChatGPT 桌面客户端接入语音交互通道 ChatGPT Voice,底层由本月早些时候推出的 ChatGPT-Live 语音模型系列驱动,用户此后可用口语指令驱动 AI 智能体在电脑上跑多步骤任务,而不再局限于打字或手机端那种偏闲聊的语音对话。

ChatGPT桌面端接Voice语音

桌面版这次把”能说”和”能做”缝在一起:语音入口同时覆盖 ChatGPT Work 与 Codex 两条链路,并打通计算机操作能力,可替用户开网页、进应用、读内容;macOS 侧借 Appshots 机制还能申请读取屏幕元素,连图片的替代文本(alt-text)也纳入可感知范围。和手机版 Voice 最初只追求打断更自然、对话更顺滑但不能真动手不同,桌面版允许一句口语里塞进多步意图,模型中途缺参数或要确认时,用户直接开口接话即可继续,无需切回键盘。

ChatGPT桌面端接Voice语音

据ITCOW牛新网了解,OpenAI 放出的演示里,一名开发者对着麦克风说了一段话,ChatGPT 便自行新建代码线程、提交 Pull Request 并定位某个 Bug 的根因;iOS 端用户则能通过远程访问在 Codex 里调用 ChatGPT Voice 发令。几乎同一窗口期,Anthropic 也给 Claude 补了语音模式,可调度 Opus、Sonnet、Haiku 三档模型,在 Gmail、Calendar、Slack、Notion、Canva 等办公应用里跑任务,两家在”语音即操作入口”上的节奏开始贴身交火。

ChatGPT桌面端接Voice语音