你話還沒說完,AI就開始搶答——這是ChatGPT語音模式最讓人尷尬的瞬間。OpenAI這次更新的重點不是把模型變得更聰明,而是先解決這個最基本的對話禮貌問題。
ChatGPT的語音功能走到現在是第三代。2023年的初代Voice Mode其實是三套系統硬接起來:先把語音轉成文字,丟給語言模型生成答案,再用另一套文字轉語音模型讀出來,中間常常有明顯的機械感。後來的Advanced Voice Mode把流程整合進單一多模態模型,體驗有進步,但仍是輪流發言的架構——你停頓一下,它就以為你講完了,然後開始接話,結果你其實還沒說完。
現在預設上場的是GPT-Live,OpenAI把它稱作「全雙工」架構,可以同時聽同時說。實際使用時最明顯的差異,是它偶爾會在你講話中間發出「嗯嗯」「對」這類短促的回應詞,像真人聽你說話時會下意識附和一樣。碰到需要推理或查資料的複雜問題,GPT-Live會把工作丟給背景的GPT-5.5之類模型處理,同時維持對話不中斷。
付費與免費版本的差異
GPT-Live目前透過iOS、Android的ChatGPT App以及網頁版都能用。Pro、Plus、Go訂閱用戶用的是GPT-Live-1模型,免費用戶則是GPT-Live-1 mini。要開始對話,只需點文字輸入框最右側那個波形符號的語音圖示,第一次使用會被要求開放麥克風權限。








