先看一組矛盾的數字。ChatGPT最新旗艦模型GPT 5.6 Sol(Max)在AA-Omniscience Hallucination Rate基準上,胡謅比例是89%——比舊款GPT-4o的38%高出一大截。同一份基準裡,GPT 5.6 Sol的知識準確率反而比前代進步。也就是說,這套模型「懂得更多」,但遇到不知道的問題時,選擇編答案而不是承認不知道的機率也變高了。
對照組是Anthropic的Claude Fable 5(Max),胡謅率55%,準確率61%,都優於GPT 5.6 Sol的59%。差距在中階模型上更明顯:Claude Sonnet 5準確率38%、胡謅率37%;ChatGPT 5.6 Terra準確率46%領先,胡謅率卻高達85%。換句話說,兩家公司在「答對更多」這件事上打平,但一遇到不會的題目,ChatGPT系模型明顯更容易硬掰。
功能面的分工也清楚。Claude今年1月推出的Cowork可以代為處理知識型任務,比如整理檔案;使用者能建立稱為skills的指令組,在對話中用「/」隨時呼叫,這套skills能跨Claude聊天、Cowork與Claude Code使用。Claude Artifacts則能即時渲染程式碼片段、單頁HTML網站、React元件和圖表,做出來的東西可以直接發布分享,還能透過Model Context Protocol連接器抓即時資料。ChatGPT也有skills,但只限Codex與API裡的個人帳號使用,一般聊天視窗用不到;對應Artifacts的功能叫Sites,鎖定企業內部使用,同樣只在Codex裡開放,且拉不到即時資料。
反過來,ChatGPT在語音體驗上明顯更成熟——聲音自然、可以打斷它說話而不會讓它忘記前面在講什麼,搭配Advanced voice mode的即時影像功能,可以把鏡頭對著眼前的問題直接問。影像生成也是ChatGPT的強項,能做出接近真實照片的圖,Claude在這塊只能靠HTML和SVG畫圖表、圖示。








