まず、ある矛盾した数字を見てみよう。ChatGPTの最新フラッグシップモデルGPT 5.6 Sol(Max)は、AA-Omniscience Hallucination Rateベンチマークにおいて、でたらめ回答の比率が89%——旧モデルGPT-4oの38%を大きく上回った。同じベンチマークで、GPT 5.6 Solの知識精度はむしろ前モデルより向上している。つまり、このモデルは「より多くを知っている」にもかかわらず、答えがわからない問題に直面した際に、素直に「知らない」と認めるのではなく、でっち上げてしまう確率も高まっているということだ。
比較対象となるのはAnthropicのClaude Fable 5(Max)で、でたらめ率は55%、精度は61%——いずれもGPT 5.6 Solの59%を上回る成績だ。この差は中位モデルでさらに顕著になる。Claude Sonnet 5は精度38%、でたらめ率37%。一方、ChatGPT 5.6 Terraは精度46%でリードするものの、でたらめ率は驚異の85%に達する。つまり両社は「正答数を増やす」という点では互角だが、わからない問題に遭遇した途端、ChatGPT系モデルの方が明らかにでっち上げに走りやすいということだ。
機能面での棲み分けもはっきりしている。Claudeが今年1月にリリースしたCowork機能は、ファイル整理などの知識作業を代行できる。ユーザーはskillsと呼ばれる指令セットを作成し、会話中に「/」でいつでも呼び出せる。このskillsはClaudeチャット、Cowork、Claude Codeを横断して利用可能だ。Claude Artifactsはコードスニペット、単一ページのHTMLサイト、Reactコンポーネント、グラフなどをリアルタイムでレンダリングでき、作成したものはそのまま公開・共有できるほか、Model Context Protocolコネクターを通じてリアルタイムデータも取得できる。ChatGPTにもskillsは存在するが、CodexとAPI内の個人アカウントに限定されており、通常のチャット画面では使えない。Artifactsに相当する機能はSitesと呼ばれ、企業内利用向けに特化しており、こちらもCodex内でのみ利用可能で、リアルタイムデータの取得にも対応していない。
逆に、ChatGPTは音声体験において明らかに一歩リードしている——声が自然で、話している最中に割り込んでも文脈を見失わない。Advanced voice modeのリアルタイム映像機能と組み合わせれば、カメラを目の前の対象に向けてそのまま質問することもできる。画像生成もChatGPTの強みで、実写に近いクオリティの画像を生成できる。Claudeはこの分野ではHTMLとSVGでグラフやアイコンを描く程度にとどまっている。








