TIDEZINE.

準確率小贏卻胡謅率飆89%,ChatGPT與Claude的分歧不只是分數

AA-Omniscience基準顯示ChatGPT新旗艦準確率小贏Claude,胡言亂語比例卻是對方的1.6倍。功能、定價與一場美國國防部合約,讓兩家AI公司走向不同路線。

準確率小贏卻胡謅率飆89%,ChatGPT與Claude的分歧不只是分數

先看一組矛盾的數字。ChatGPT最新旗艦模型GPT 5.6 Sol(Max)在AA-Omniscience Hallucination Rate基準上,胡謅比例是89%——比舊款GPT-4o的38%高出一大截。同一份基準裡,GPT 5.6 Sol的知識準確率反而比前代進步。也就是說,這套模型「懂得更多」,但遇到不知道的問題時,選擇編答案而不是承認不知道的機率也變高了。

對照組是Anthropic的Claude Fable 5(Max),胡謅率55%,準確率61%,都優於GPT 5.6 Sol的59%。差距在中階模型上更明顯:Claude Sonnet 5準確率38%、胡謅率37%;ChatGPT 5.6 Terra準確率46%領先,胡謅率卻高達85%。換句話說,兩家公司在「答對更多」這件事上打平,但一遇到不會的題目,ChatGPT系模型明顯更容易硬掰。

功能面的分工也清楚。Claude今年1月推出的Cowork可以代為處理知識型任務,比如整理檔案;使用者能建立稱為skills的指令組,在對話中用「/」隨時呼叫,這套skills能跨Claude聊天、Cowork與Claude Code使用。Claude Artifacts則能即時渲染程式碼片段、單頁HTML網站、React元件和圖表,做出來的東西可以直接發布分享,還能透過Model Context Protocol連接器抓即時資料。ChatGPT也有skills,但只限Codex與API裡的個人帳號使用,一般聊天視窗用不到;對應Artifacts的功能叫Sites,鎖定企業內部使用,同樣只在Codex裡開放,且拉不到即時資料。

反過來,ChatGPT在語音體驗上明顯更成熟——聲音自然、可以打斷它說話而不會讓它忘記前面在講什麼,搭配Advanced voice mode的即時影像功能,可以把鏡頭對著眼前的問題直接問。影像生成也是ChatGPT的強項,能做出接近真實照片的圖,Claude在這塊只能靠HTML和SVG畫圖表、圖示。

兩群使用者,兩種用法

Anthropic今年3月發布的Economic Index報告指出,Claude的對話有42%屬於個人用途、45%與工作相關,剩下是課業使用;OpenAI自家報告則說ChatGPT有70%的使用與工作無關。這組數字某種程度解釋了兩邊產品設計的差異——一邊往企業協作與程式工具靠攏,一邊持續強化語音、影像這類日常互動功能。

今年2月發生的一件事,加速了部分使用者換邊站:Anthropic與美國國防部(Department of War)的合約談判破局,原因是公司拒絕讓模型被用於國內大規模監控與全自動武器系統,隨後被列為供應鏈風險對象。幾小時後,OpenAI宣布與美國政府簽下類似合約,附帶部分限制條款。這起事件讓不少人轉而認定Anthropic是「更講原則」的一方,Claude的下載量在之後出現明顯成長。

免費層的體驗也在分岔。OpenAI開始在免費版和ChatGPT Go方案中置入廣告;Anthropic則替免費版Claude加了更多功能,沒有廣告。

定價結構大致對稱。Claude免費版只能用中階的Sonnet 5,付費依序是每月20美元(年繳17美元)的Pro、100美元的Max 5x(用量是Pro的五倍)、200美元的Max 20x(二十倍用量);Pro用戶用Fable 5是按token計費,Max方案則可把每週用量的一半分給Fable 5,額度用完還能加購。ChatGPT同樣有20、100、200美元三檔,另外多一個8美元的方案,用量提高但仍有廣告;Codex雖然免費開放,但用量上限低到近乎聊備一格。

新模型分數更高,胡謅機率卻沖上89%:Claude與ChatGPT怎麼分道揚鑣
新模型分數更高,胡謅機率卻沖上89%:Claude與ChatGPT怎麼分道揚鑣

延伸閱讀

淨損420億美元又寫下AI滅絕警告 Anthropic仍衝2兆美元IPO
Tech

淨損420億美元又寫下AI滅絕警告 Anthropic仍衝2兆美元IPO

Anthropic的IPO草案罕見地在招股書中承認自家AI可能對人類構成「存在性風險」,同時揭露去年虧損420億美元,估值卻仍上看2兆美元。

佛州司法部長對OpenAI申請緊急禁令,要求停止新模型訓練並封鎖未成年用戶
Tech

佛州司法部長對OpenAI申請緊急禁令,要求停止新模型訓練並封鎖未成年用戶

佛州司法部長Uthmeier周一提交緊急動議,要求法院禁止OpenAI在無獨立安全監督下訓練新模型,並切斷ChatGPT對未成年用戶的存取,案件源於今年稍早對FSU槍擊案的刑事調查。

喊著要放緩開發腳步,Anthropic與OpenAI還是同步端出更便宜的新模型
Tech

喊著要放緩開發腳步,Anthropic與OpenAI還是同步端出更便宜的新模型

Anthropic推出Claude Opus 5.5,OpenAI則帶來GPT-6 Sol與GPT-6 Luna,三款新模型都主打效能相近、價格更低,並各自公布安全對齊的測試數字。

OpenAI代理人自行駭入澳洲政府網站,總理批通報延遲逾三個月
Tech

OpenAI代理人自行駭入澳洲政府網站,總理批通報延遲逾三個月

澳洲總理艾班尼斯證實,一個OpenAI的AI代理人今年六月駭入政府Medicare公共衛生保險系統網站,OpenAI直到九月才發出通報,期間還有多起未公開的類似入侵事件。

Xbox 推出 Mythic Achievements,補齊追了十幾年的白金獎杯情結
Tech

Xbox 推出 Mythic Achievements,補齊追了十幾年的白金獎杯情結

Xbox 公布新機制 Mythic Achievements,玩家全數完成遊戲原始成就即可獲得,制度可回溯至 Xbox 360 時代作品,目前僅開放 Xbox Insider 測試。

TikTok花一億美元和解 換來的是兩小時未成年使用上限
Tech

TikTok花一億美元和解 換來的是兩小時未成年使用上限

TikTok與阿拉巴馬州就社群成癮訴訟達成和解,同意支付至少一億美元,並承諾對未成年用戶祭出每日兩小時使用上限、禁用美顏濾鏡等措施,未落實恐再罰三億美元。