TIDEZINE.

准确率小赢却胡诌率飙89%,ChatGPT与Claude的分歧不只是分数

AA-Omniscience基准显示ChatGPT新旗舰准确率小赢Claude,胡言乱语比例却是对方的1.6倍。功能、定价与一场美国国防部合约,让两家AI公司走向不同路线。

准确率小赢却胡诌率飙89%,ChatGPT与Claude的分歧不只是分数

先看一组矛盾的数字。ChatGPT最新旗舰模型GPT 5.6 Sol(Max)在AA-Omniscience Hallucination Rate基准上,胡诌比例是89%——比旧款GPT-4o的38%高出一大截。同一份基准里,GPT 5.6 Sol的知识准确率反而比前代进步。也就是说,这套模型「懂得更多」,但遇到不知道的问题时,选择编答案而不是承认不知道的概率也变高了。

对照组是Anthropic的Claude Fable 5(Max),胡诌率55%,准确率61%,都优于GPT 5.6 Sol的59%。差距在中阶模型上更明显:Claude Sonnet 5准确率38%、胡诌率37%;ChatGPT 5.6 Terra准确率46%领先,胡诌率却高达85%。换句话说,两家公司在「答对更多」这件事上打平,但一遇到不会的题目,ChatGPT系模型明显更容易硬掰。

功能面的分工也清楚。Claude今年1月推出的Cowork可以代为处理知识型任务,比如整理文件;用户能创建称为skills的指令组,在对话中用「/」随时调用,这套skills能跨Claude聊天、Cowork与Claude Code使用。Claude Artifacts则能实时渲染代码片段、单页HTML网站、React组件和图表,做出来的东西可以直接发布分享,还能透过Model Context Protocol连接器抓实时数据。ChatGPT也有skills,但只限Codex与API里的个人帐号使用,一般聊天窗口用不到;对应Artifacts的功能叫Sites,锁定企业内部使用,同样只在Codex里开放,且拉不到实时数据。

反过来,ChatGPT在语音体验上明显更成熟——声音自然、可以打断它说话而不会让它忘记前面在讲什么,搭配Advanced voice mode的实时图像功能,可以把镜头对着眼前的问题直接问。图像生成也是ChatGPT的强项,能做出接近真实照片的图,Claude在这块只能靠HTML和SVG画图表、图标。

两群用户,两种用法

Anthropic今年3月发布的Economic Index报告指出,Claude的对话有42%属于个人用途、45%与工作相关,剩下是课业使用;OpenAI自家报告则说ChatGPT有70%的使用与工作无关。这组数字某种程度解释了两边产品设计的差异——一边往企业协作与程序工具靠拢,一边持续强化语音、图像这类日常交互功能。

今年2月发生的一件事,加速了部分用户换边站:Anthropic与美国国防部(Department of War)的合约谈判破局,原因是公司拒绝让模型被用于国内大规模监控与全自动武器系统,随后被列为供应链风险对象。几小时后,OpenAI宣布与美国政府签下类似合约,附带部分限制条款。这起事件让不少人转而认定Anthropic是「更讲原则」的一方,Claude的下载量在之后出现明显成长。

免费层的体验也在分岔。OpenAI开始在免费版和ChatGPT Go方案中置入广告;Anthropic则替免费版Claude加了更多功能,没有广告。

定价结构大致对称。Claude免费版只能用中阶的Sonnet 5,付费依序是每月20美元(年缴17美元)的Pro、100美元的Max 5x(用量是Pro的五倍)、200美元的Max 20x(二十倍用量);Pro用户用Fable 5是按token计费,Max方案则可把每周用量的一半分给Fable 5,额度用完还能加购。ChatGPT同样有20、100、200美元三档,另外多一个8美元的方案,用量提高但仍有广告;Codex虽然免费开放,但用量上限低到近乎聊备一格。

新模型分数更高,胡诌概率却冲上89%:Claude与ChatGPT怎么分道扬镳
新模型分数更高,胡诌概率却冲上89%:Claude与ChatGPT怎么分道扬镳

延伸阅读

净损420亿美元又写下AI灭绝警告 Anthropic仍冲2兆美元IPO
Tech

净损420亿美元又写下AI灭绝警告 Anthropic仍冲2兆美元IPO

Anthropic的IPO草案罕见地在招股书中承认自家AI可能对人类构成「存在性风险」,同时揭露去年亏损420亿美元,估值却仍上看2兆美元。

佛州司法部长对OpenAI申请紧急禁令,要求停止新模型训练并封锁未成年用户
Tech

佛州司法部长对OpenAI申请紧急禁令,要求停止新模型训练并封锁未成年用户

佛州司法部长Uthmeier周一提交紧急动议,要求法院禁止OpenAI在无独立安全监督下训练新模型,并切断ChatGPT对未成年用户的访问,案件源于今年稍早对FSU枪击案的刑事调查。

喊着要放缓开发脚步,Anthropic与OpenAI还是同步端出更便宜的新模型
Tech

喊着要放缓开发脚步,Anthropic与OpenAI还是同步端出更便宜的新模型

Anthropic推出Claude Opus 5.5,OpenAI则带来GPT-6 Sol与GPT-6 Luna,三款新模型都主打性能相近、价格更低,并各自公布安全对齐的测试数字。

OpenAI代理人自行骇入澳洲政府网站,总理批通报延迟逾三个月
Tech

OpenAI代理人自行骇入澳洲政府网站,总理批通报延迟逾三个月

澳洲总理艾班尼斯证实,一个OpenAI的AI代理人今年六月骇入政府Medicare公共卫生保险系统网站,OpenAI直到九月才发出通报,期间还有多起未公开的类似入侵事件。

Xbox 推出 Mythic Achievements,补齐追了十几年的白金奖杯情结
Tech

Xbox 推出 Mythic Achievements,补齐追了十几年的白金奖杯情结

Xbox 公布新机制 Mythic Achievements,玩家全数完成游戏原始成就即可获得,制度可回溯至 Xbox 360 时代作品,目前仅开放 Xbox Insider 测试。

TikTok花一亿美元和解 换来的是两小时未成年使用上限
Tech

TikTok花一亿美元和解 换来的是两小时未成年使用上限

TikTok与阿拉巴马州就社区成瘾诉讼达成和解,同意支付至少一亿美元,并承诺对未成年用户祭出每日两小时使用上限、禁用美颜滤镜等措施,未落实恐再罚三亿美元。