ChatGPT Voice 是什么?
ChatGPT Voice 是什么? 核心功能 版本/套餐对比 值不值得用? 使用建议 适合谁用?(三档) ChatGPT Voice 是 OpenAI 于 2026 年 8 月 9 日为 ChatGPT 桌面应用上线的语音交互功能,底层基于当月早些时候推出的全新 GPT-Live 语音模型系列。它把 ChatGPT 从打字问答升级为动口指挥:你可以用自然语言直接对话、控制 AI 智能体,并让它在电脑上执行任务,比如创建代码线程、提交 Pull Request、定位 Bug 根本原因。简单说,语音不再是附属的输入方式,而是驱动 Agent 干活的入口。 付费用户(Pro/Plus/Go)默认使用完整的 GPT-Live-1 模型;免费用户可使用更轻量的 GPT-Live-1 mini。语音功能本身随 ChatGPT 订阅包含,无需额外付费。 如果你本来就重度使用 ChatGPT,尤其在做开发或桌面办公,这次升级值得马上试。全双工解决了老版语音最恼人的抢话问题,桌面端的执行能力又让语音从聊天变成了办事。不过它目前仍是助手而非自动驾驶,敏感操作仍需你点头。
- 全双工语音:真正能同时听和说,可以打断、可以停顿,不再因为短暂沉默被抢话,对话接近真人。
- 桌面端执行力:通过语音下达包含多个步骤的复杂指令,并在 AI 需要补充信息或确认时随时回应。
- 联动 Work 与 Codex:ChatGPT Voice 同时支持 ChatGPT Work 和 Codex,可调用计算机操作能力访问网站与应用。
- 屏幕理解:在 macOS 上借助 Appshots,可授权 ChatGPT 读取屏幕内容(含 alt-text),让语音指令更有的放矢。
- 移动远程:通过 iOS 应用的远程访问功能,也能在 Codex 中使用 ChatGPT Voice。
优点
- + 全双工自然对话,可打断、可停顿,不再抢话
- + 桌面端能语音控制 Agent 执行多步骤任务
- + 支持 ChatGPT Work 与 Codex,可调用计算机操作能力
- + macOS 上通过 Appshots 读取屏幕内容(含 alt-text)
- + iOS 远程访问可在 Codex 中使用语音
缺点
- - 涉及付款、发消息、改权限等敏感操作仍需手动确认
- - 暂不支持屏幕共享与视频共享
ChatGPT Voice 和旧版语音有什么区别?
核心变化是换成 ChatGPT-Live 全双工模型,可同时听和说、能打断停顿;桌面端还新增了控制 Agent 在电脑上执行多步骤任务的能力。
免费用户能用吗?
可以,免费用户使用更轻量的 GPT-Live-1 mini;Pro/Plus/Go 等付费用户可使用完整的 GPT-Live-1,语音功能本身随订阅包含。
它能直接帮我操作电脑吗?
桌面端可以调用计算机操作能力访问网站与应用、执行多步骤指令,但涉及付款、发消息、改权限等高风险操作会强制要求你手动确认。
手机端能用语音控制 Codex 吗?
可以,通过 iOS 应用的远程访问功能,就能在 Codex 中使用 ChatGPT Voice。
常见问题
用户评价