你话还没说完,AI就开始抢答——这是ChatGPT语音模式最让人尴尬的瞬间。OpenAI这次更新的重点不是把模型变得更聪明,而是先解决这个最基本的对话礼貌问题。
ChatGPT的语音功能走到现在是第三代。2023年的初代Voice Mode其实是三套系统硬接起来:先把语音转成文字,丢给语言模型生成答案,再用另一套文字转语音模型读出来,中间常常有明显的机械感。后来的Advanced Voice Mode把流程集成进单一多模态模型,体验有进步,但仍是轮流发言的架构——你停顿一下,它就以为你讲完了,然后开始接话,结果你其实还没说完。
现在预设上场的是GPT-Live,OpenAI把它称作「全双工」架构,可以同时听同时说。实际使用时最明显的差异,是它偶尔会在你讲话中间发出「嗯嗯」「对」这类短促的回应词,像真人听你说话时会下意识附和一样。碰到需要推理或查数据的复杂问题,GPT-Live会把工作丢给背景的GPT-5.5之类模型处理,同时维持对话不中断。
付费与免费版本的差异
GPT-Live目前透过iOS、Android的ChatGPT App以及网页版都能用。Pro、Plus、Go订阅用户用的是GPT-Live-1模型,免费用户则是GPT-Live-1 mini。要开始对话,只需点文字输入框最右侧那个波形符号的语音图标,第一次使用会被要求开放麦克风权限。








