先看一组矛盾的数字。ChatGPT最新旗舰模型GPT 5.6 Sol(Max)在AA-Omniscience Hallucination Rate基准上,胡诌比例是89%——比旧款GPT-4o的38%高出一大截。同一份基准里,GPT 5.6 Sol的知识准确率反而比前代进步。也就是说,这套模型「懂得更多」,但遇到不知道的问题时,选择编答案而不是承认不知道的概率也变高了。
对照组是Anthropic的Claude Fable 5(Max),胡诌率55%,准确率61%,都优于GPT 5.6 Sol的59%。差距在中阶模型上更明显:Claude Sonnet 5准确率38%、胡诌率37%;ChatGPT 5.6 Terra准确率46%领先,胡诌率却高达85%。换句话说,两家公司在「答对更多」这件事上打平,但一遇到不会的题目,ChatGPT系模型明显更容易硬掰。
功能面的分工也清楚。Claude今年1月推出的Cowork可以代为处理知识型任务,比如整理文件;用户能创建称为skills的指令组,在对话中用「/」随时调用,这套skills能跨Claude聊天、Cowork与Claude Code使用。Claude Artifacts则能实时渲染代码片段、单页HTML网站、React组件和图表,做出来的东西可以直接发布分享,还能透过Model Context Protocol连接器抓实时数据。ChatGPT也有skills,但只限Codex与API里的个人帐号使用,一般聊天窗口用不到;对应Artifacts的功能叫Sites,锁定企业内部使用,同样只在Codex里开放,且拉不到实时数据。
反过来,ChatGPT在语音体验上明显更成熟——声音自然、可以打断它说话而不会让它忘记前面在讲什么,搭配Advanced voice mode的实时图像功能,可以把镜头对着眼前的问题直接问。图像生成也是ChatGPT的强项,能做出接近真实照片的图,Claude在这块只能靠HTML和SVG画图表、图标。








