Z.ai는 GLM-5.3을 "가장 강력한 오픈소스 코딩 모델"이라 부르지만, 정작 자사가 공개한 벤치마크 표를 펼쳐보면 이야기가 그리 깔끔하지 않다. Terminal Bench 3.0에서 GLM-5.3은 28.3점을 기록해 폐쇄형 모델인 Claude Fable 5(33.7점)와 GPT-5.6 Sol(34.6점)에 뒤처졌다. 실제 GitHub 이슈를 처리하는 DeepSWE v1.1 테스트에서도 66.9점으로 오픈소스 동종 업계인 Kimi K3의 67.5점, Fable 5의 69.7점을 넘지 못했다. 자신이 최강임을 증명하려던 공식 문서가 오히려 '최강이 아니다'라는 점을 명확히 드러낸 셈이다.
GLM-5.3은 목요일 GLM Coding Plan 구독 서비스와 ZCode를 통해 출시됐으며, API와 다운로드 가능한 가중치는 보안 심사를 거친 뒤 단계적으로 공개될 예정이다. 이 모델은 743억 파라미터 규모로, GLM-5.2의 기반 위에서 post-training 학습량을 계속 늘려가며 만들어졌다. Z.ai는 발표문에서 "Scaling post-training is all we did for GLM-5.3"이라며, 지난 한 달 동안 더 많은 환경과 다양한 태스크, 그리고 더 많은 컴퓨팅 자원을 투입했다고 설명했다.
이번 발표의 핵심은 점수를 무작정 끌어올리는 게 아니라 토큰을 절약하는 데 있다. Z.ai 자체 Code Bench 테스트에서 GLM-5.3은 Max effort 모드로 34.5%를 기록했으며, 태스크당 평균 약 75,000개의 출력 토큰을 소모했다. 반면 GLM-5.2는 23.4%에 그쳤지만 96,000개의 토큰을 태웠다. 다시 말해 신규 모델은 점수는 올라가고 '연비'는 오히려 좋아진 셈이다. Claude Opus 4.8과 비교하면 Z.ai는 GLM-5.3의 토큰 효율성이 더 낫다고 밝혔지만, 동시에 "remains behind Claude Fable 5, which reaches 39.5% at Max effort"라는 문구도 자사 블로그에 스스로 적어 넣었다.






