Z.ai把GLM-5.3叫做「最具能力的開源coding模型」,但翻開它自己貼出的跑分表,故事沒那麼乾脆。在Terminal Bench 3.0上,GLM-5.3拿下28.3分,輸給閉源的Claude Fable 5(33.7)和GPT-5.6 Sol(34.6);在處理真實GitHub issue的DeepSWE v1.1測試裡,它的66.9分也不敵開源同行Kimi K3的67.5,以及Fable 5的69.7。一份用來證明自己最強的官方文件,反而把「不是最強」寫得很清楚。
GLM-5.3是在週四透過GLM Coding Plan訂閱與ZCode上線的,API和可下載的權重要等安全審查後分階段釋出。這顆模型有743億參數,是在GLM-5.2的底座上持續擴大post-training訓練量做出來的——Z.ai在發布文裡的說法是「Scaling post-training is all we did for GLM-5.3」,過去一個月加了更多環境、更多樣的任務,以及更多算力。
這次的重點不是把分數往上堆,而是省token。在Z.ai自家的Code Bench測試裡,GLM-5.3在Max effort下拿到34.5%,平均每個任務燒掉約75,000個輸出token;GLM-5.2則是23.4%,卻要燒到96,000個token。換句話說,新模型分數漲了、油耗反而降了。跟Claude Opus 4.8比,Z.ai說GLM-5.3的token經濟性更好,但一樣承認「remains behind Claude Fable 5, which reaches 39.5% at Max effort」——這句話是自己寫在部落格裡的。






