你話還沒說完,AI就開始搶答——這是ChatGPT語音模式最讓人尷尬的瞬間。OpenAI這次更新的重點不是把模型變得更聰明,而是先解決這個最基本的對話禮貌問題。
ChatGPT的語音功能走到現在是第三代。2023年的初代Voice Mode其實是三套系統硬接起來:先把語音轉成文字,丟給語言模型生成答案,再用另一套文字轉語音模型讀出來,中間常常有明顯的機械感。後來的Advanced Voice Mode把流程整合進單一多模態模型,體驗有進步,但仍是輪流發言的架構——你停頓一下,它就以為你講完了,然後開始接話,結果你其實還沒說完。
現在預設上場的是GPT-Live,OpenAI把它稱作「全雙工」架構,可以同時聽同時說。實際使用時最明顯的差異,是它偶爾會在你講話中間發出「嗯嗯」「對」這類短促的回應詞,像真人聽你說話時會下意識附和一樣。碰到需要推理或查資料的複雜問題,GPT-Live會把工作丟給背景的GPT-5.5之類模型處理,同時維持對話不中斷。
付費與免費版本的差異
GPT-Live目前透過iOS、Android的ChatGPT App以及網頁版都能用。Pro、Plus、Go訂閱用戶用的是GPT-Live-1模型,免費用戶則是GPT-Live-1 mini。要開始對話,只需點文字輸入框最右側那個波形符號的語音圖示,第一次使用會被要求開放麥克風權限。
進入語音模式後畫面上會出現一顆會隨聲音反應的懸浮球體。點右上角設定圖示,可以在Instant、Medium、High三個智慧等級之間切換——但這項自訂功能只開放給付費方案,mini版本目前不能調整。語音對話期間切到其他App或把手機鎖起來,ChatGPT仍會保持通話狀態。
GPT-Live目前還不支援螢幕或畫面分享,如果需要這項功能,可以到設定裡的Voice選單切回舊版語音模型,同一個選單也能換發音、改語言,或把語音模式設成App啟動後的預設狀態。

會邊講邊等你的感覺
Engadget編輯Adnan Ahmed原本習慣打字輸入,對語音功能不太有感,直到真正用GPT-Live聊了幾段較長的對話才改觀。讓他印象深刻的不是回答有多聰明,而是很快就忘記自己在跟AI講話這件事——不會被打斷,也不用尷尬地等它講完才能插話,講長句子時甚至有種對方在預判接下來要說什麼的感覺。
這種即時反應也讓GPT-Live適合拿來做即時口譯。對話過程中隨時往下滑可以看到完整逐字稿,如果問題適合用圖表或介面呈現,系統會在語音回答旁生成互動式視覺元件。
智慧等級預設為Instant,處理日常問題夠快夠用,遇到需要查證或深度推理的內容仍會把任務丟到背景模型處理。如果經常討論複雜議題,切到Medium或High會多花一兩秒思考時間,但這點延遲並不影響對話的流暢度。







