你话还没说完,AI就开始抢答——这是ChatGPT语音模式最让人尴尬的瞬间。OpenAI这次更新的重点不是把模型变得更聪明,而是先解决这个最基本的对话礼貌问题。
ChatGPT的语音功能走到现在是第三代。2023年的初代Voice Mode其实是三套系统硬接起来:先把语音转成文字,丢给语言模型生成答案,再用另一套文字转语音模型读出来,中间常常有明显的机械感。后来的Advanced Voice Mode把流程集成进单一多模态模型,体验有进步,但仍是轮流发言的架构——你停顿一下,它就以为你讲完了,然后开始接话,结果你其实还没说完。
现在预设上场的是GPT-Live,OpenAI把它称作「全双工」架构,可以同时听同时说。实际使用时最明显的差异,是它偶尔会在你讲话中间发出「嗯嗯」「对」这类短促的回应词,像真人听你说话时会下意识附和一样。碰到需要推理或查数据的复杂问题,GPT-Live会把工作丢给背景的GPT-5.5之类模型处理,同时维持对话不中断。
付费与免费版本的差异
GPT-Live目前透过iOS、Android的ChatGPT App以及网页版都能用。Pro、Plus、Go订阅用户用的是GPT-Live-1模型,免费用户则是GPT-Live-1 mini。要开始对话,只需点文字输入框最右侧那个波形符号的语音图标,第一次使用会被要求开放麦克风权限。
进入语音模式后画面上会出现一颗会随声音反应的悬浮球体。点右上角设置图标,可以在Instant、Medium、High三个智能等级之间切换——但这项自订功能只开放给付费方案,mini版本目前不能调整。语音对话期间切到其他App或把手机锁起来,ChatGPT仍会保持通话状态。
GPT-Live目前还不支持屏幕或画面分享,如果需要这项功能,可以到设置里的Voice菜单切回旧版语音模型,同一个菜单也能换发音、改语言,或把语音模式设成App启动后的预设状态。

会边讲边等你的感觉
Engadget编辑Adnan Ahmed原本习惯打字输入,对语音功能不太有感,直到真正用GPT-Live聊了几段较长的对话才改观。让他印象深刻的不是回答有多聪明,而是很快就忘记自己在跟AI讲话这件事——不会被打断,也不用尴尬地等它讲完才能插话,讲长句子时甚至有种对方在预判接下来要说什么的感觉。
这种实时反应也让GPT-Live适合拿来做实时口译。对话过程中随时往下滑可以看到完整逐字稿,如果问题适合用图表或界面呈现,系统会在语音回答旁生成交互式视觉组件。
智能等级预设为Instant,处理日常问题够快够用,遇到需要查证或深度推理的内容仍会把任务丢到背景模型处理。如果经常讨论复杂议题,切到Medium或High会多花一两秒思考时间,但这点延迟并不影响对话的流畅度。







