먼저 모순되는 숫자부터 살펴보자. ChatGPT의 최신 플래그십 모델 GPT 5.6 Sol(Max)은 AA-Omniscience Hallucination Rate 벤치마크에서 헛소리 비율이 89%를 기록했다. 구형 모델인 GPT-4o의 38%보다 훨씬 높은 수치다. 같은 벤치마크에서 GPT 5.6 Sol의 지식 정확도는 오히려 이전 세대보다 향상됐다. 즉, 이 모델은 "더 많이 알고" 있지만, 모르는 문제를 마주쳤을 때 "모른다"고 인정하는 대신 답을 지어낼 확률도 함께 높아졌다는 뜻이다.
비교 대상인 Anthropic의 Claude Fable 5(Max)는 헛소리 비율 55%, 정확도 61%로 GPT 5.6 Sol의 59%보다 모두 우수했다. 중급 모델에서는 격차가 더 뚜렷하다. Claude Sonnet 5는 정확도 38%, 헛소리 비율 37%인 반면, ChatGPT 5.6 Terra는 정확도 46%로 앞섰지만 헛소리 비율은 무려 85%에 달했다. 다시 말해 두 회사는 "정답을 더 많이 맞히는" 측면에서는 비슷한 수준이지만, 모르는 문제를 만났을 때 ChatGPT 계열 모델이 훨씬 더 쉽게 답을 지어내는 경향을 보인다.
기능 면에서의 역할 분담도 뚜렷하다. Claude가 올해 1월 출시한 Cowork는 파일 정리 같은 지식 기반 작업을 대신 처리해준다. 사용자는 skills라는 명령어 세트를 만들어 대화 중 "/"로 언제든 호출할 수 있으며, 이 skills는 Claude 채팅, Cowork, Claude Code 전반에서 사용 가능하다. Claude Artifacts는 코드 조각, 단일 페이지 HTML 웹사이트, React 컴포넌트, 차트 등을 실시간으로 렌더링할 수 있고, 결과물을 곧바로 게시하고 공유할 수 있으며 Model Context Protocol 커넥터를 통해 실시간 데이터도 가져올 수 있다. ChatGPT에도 skills가 있지만 Codex와 API 내 개인 계정에서만 사용 가능하고 일반 채팅창에서는 쓸 수 없다. Artifacts에 대응하는 기능은 Sites인데, 기업 내부 사용에 초점이 맞춰져 있고 역시 Codex에서만 열려 있으며 실시간 데이터도 가져오지 못한다.
반대로 ChatGPT는 음성 경험 면에서 확연히 더 성숙하다. 목소리가 자연스럽고, 말을 끊어도 이전 맥락을 잊지 않으며, Advanced voice mode의 실시간 영상 기능과 결합하면 카메라를 눈앞의 문제에 비춰 바로 질문할 수 있다. 이미지 생성도 ChatGPT의 강점으로, 실제 사진에 가까운 이미지를 만들어낼 수 있다. Claude는 이 부분에서 HTML과 SVG로 차트나 아이콘을 그리는 정도에 그친다.








