Z.aiはGLM-5.3を「最も能力の高いオープンソースコーディングモデル」と呼んでいるが、自ら公開したベンチマーク表を開くと、話はそう単純ではない。Terminal Bench 3.0でGLM-5.3は28.3点を獲得したものの、クローズドソースのClaude Fable 5(33.7)やGPT-5.6 Sol(34.6)に敗れている。実際のGitHub issueを処理するDeepSWE v1.1テストでも66.9点にとどまり、オープンソース同業のKimi K3(67.5)やFable 5(69.7)に及ばない。自らの強さを証明するはずの公式資料が、逆に「最強ではない」ことを明確に物語ってしまっている。
GLM-5.3は木曜日、GLM Coding PlanのサブスクリプションとZCodeを通じて公開された。APIとダウンロード可能な重みについては、安全性審査を経て段階的にリリースされる予定だ。このモデルは743億パラメータで、GLM-5.2のベースをもとにpost-trainingの量を継続的に拡大して作られたもの——Z.aiは発表文の中で「Scaling post-training is all we did for GLM-5.3」と述べており、この1カ月でより多くの環境、より多様なタスク、そしてより多くの計算リソースを投入したという。
今回の主眼はスコアの底上げではなく、トークン消費の削減にある。Z.ai独自のCode Benchテストでは、GLM-5.3はMax effortモードで34.5%を達成し、1タスクあたり平均約75,000の出力トークンを消費した。一方GLM-5.2は23.4%にとどまりながら96,000トークンも消費していた。つまり新モデルはスコアが上がった一方で、燃費はむしろ改善したことになる。Claude Opus 4.8と比較すると、Z.aiは「GLM-5.3の方がトークン効率が良い」としながらも、「remains behind Claude Fable 5, which reaches 39.5% at Max effort」と自ら認めている——これは公式ブログに自分たちで書いた一文だ。






