先看一组矛盾的数字。ChatGPT最新旗舰模型GPT 5.6 Sol(Max)在AA-Omniscience Hallucination Rate基准上,胡诌比例是89%——比旧款GPT-4o的38%高出一大截。同一份基准里,GPT 5.6 Sol的知识准确率反而比前代进步。也就是说,这套模型「懂得更多」,但遇到不知道的问题时,选择编答案而不是承认不知道的概率也变高了。
对照组是Anthropic的Claude Fable 5(Max),胡诌率55%,准确率61%,都优于GPT 5.6 Sol的59%。差距在中阶模型上更明显:Claude Sonnet 5准确率38%、胡诌率37%;ChatGPT 5.6 Terra准确率46%领先,胡诌率却高达85%。换句话说,两家公司在「答对更多」这件事上打平,但一遇到不会的题目,ChatGPT系模型明显更容易硬掰。
功能面的分工也清楚。Claude今年1月推出的Cowork可以代为处理知识型任务,比如整理文件;用户能创建称为skills的指令组,在对话中用「/」随时调用,这套skills能跨Claude聊天、Cowork与Claude Code使用。Claude Artifacts则能实时渲染代码片段、单页HTML网站、React组件和图表,做出来的东西可以直接发布分享,还能透过Model Context Protocol连接器抓实时数据。ChatGPT也有skills,但只限Codex与API里的个人帐号使用,一般聊天窗口用不到;对应Artifacts的功能叫Sites,锁定企业内部使用,同样只在Codex里开放,且拉不到实时数据。
反过来,ChatGPT在语音体验上明显更成熟——声音自然、可以打断它说话而不会让它忘记前面在讲什么,搭配Advanced voice mode的实时图像功能,可以把镜头对着眼前的问题直接问。图像生成也是ChatGPT的强项,能做出接近真实照片的图,Claude在这块只能靠HTML和SVG画图表、图标。
两群用户,两种用法
Anthropic今年3月发布的Economic Index报告指出,Claude的对话有42%属于个人用途、45%与工作相关,剩下是课业使用;OpenAI自家报告则说ChatGPT有70%的使用与工作无关。这组数字某种程度解释了两边产品设计的差异——一边往企业协作与程序工具靠拢,一边持续强化语音、图像这类日常交互功能。
今年2月发生的一件事,加速了部分用户换边站:Anthropic与美国国防部(Department of War)的合约谈判破局,原因是公司拒绝让模型被用于国内大规模监控与全自动武器系统,随后被列为供应链风险对象。几小时后,OpenAI宣布与美国政府签下类似合约,附带部分限制条款。这起事件让不少人转而认定Anthropic是「更讲原则」的一方,Claude的下载量在之后出现明显成长。
免费层的体验也在分岔。OpenAI开始在免费版和ChatGPT Go方案中置入广告;Anthropic则替免费版Claude加了更多功能,没有广告。
定价结构大致对称。Claude免费版只能用中阶的Sonnet 5,付费依序是每月20美元(年缴17美元)的Pro、100美元的Max 5x(用量是Pro的五倍)、200美元的Max 20x(二十倍用量);Pro用户用Fable 5是按token计费,Max方案则可把每周用量的一半分给Fable 5,额度用完还能加购。ChatGPT同样有20、100、200美元三档,另外多一个8美元的方案,用量提高但仍有广告;Codex虽然免费开放,但用量上限低到近乎聊备一格。








