Z.ai把GLM-5.3叫做「最具能力的開源coding模型」,但翻開它自己貼出的跑分表,故事沒那麼乾脆。在Terminal Bench 3.0上,GLM-5.3拿下28.3分,輸給閉源的Claude Fable 5(33.7)和GPT-5.6 Sol(34.6);在處理真實GitHub issue的DeepSWE v1.1測試裡,它的66.9分也不敵開源同行Kimi K3的67.5,以及Fable 5的69.7。一份用來證明自己最強的官方文件,反而把「不是最強」寫得很清楚。
GLM-5.3是在週四透過GLM Coding Plan訂閱與ZCode上線的,API和可下載的權重要等安全審查後分階段釋出。這顆模型有743億參數,是在GLM-5.2的底座上持續擴大post-training訓練量做出來的——Z.ai在發布文裡的說法是「Scaling post-training is all we did for GLM-5.3」,過去一個月加了更多環境、更多樣的任務,以及更多算力。
這次的重點不是把分數往上堆,而是省token。在Z.ai自家的Code Bench測試裡,GLM-5.3在Max effort下拿到34.5%,平均每個任務燒掉約75,000個輸出token;GLM-5.2則是23.4%,卻要燒到96,000個token。換句話說,新模型分數漲了、油耗反而降了。跟Claude Opus 4.8比,Z.ai說GLM-5.3的token經濟性更好,但一樣承認「remains behind Claude Fable 5, which reaches 39.5% at Max effort」——這句話是自己寫在部落格裡的。
真正的亮點在資安測試。GLM-5.3在CyberGym拿下84.5%,在漏洞挖掘類的benchmark上分數是GLM-5.2的兩倍以上。Z.ai表示這顆模型在269個開源專案裡揪出2,436個漏洞,其中1,097個被判定為中高風險。這是這次發布裡少數沒有被自己數據打臉的部分。
價格是開源模型還能打的地方。GLM-5.2的官方API報價是每百萬token輸入1.40美元、輸出4.40美元,Z.ai說整體API定價大約是美國前沿模型的十分之一。對比之下,GPT-5.3-Codex是1.75美元進、14美元出,Claude Opus 4.8的定價更是站在Anthropic價格表的最頂層。GLM Coding Plan本身走點數額度制,離峰時段用量還打對折。
「open-weights」這個標籤,目前其實還沒兌現。發布文裡寫得清楚,權重要再過大約兩週才會公開釋出,現在能用的是訂閱制的GLM Coding Plan和ZCode,不是能下載回家跑的檔案。Z.ai是被列入美國Entity List的北京實驗室,美國公司不能對它出口受管制技術——即便如此,中國的開源模型在OpenRouter上的token使用量已經超過美國同類模型,GLM系列本身也相當受歡迎。
總結這份自曝其短的公告:GLM-5.3打贏了自己的上一代,也贏過部分開源對手,但在最顯眼的coding榜單上,閉源的美國前沿模型還是站在前面,而它引以為傲的「開源」,此刻仍是一句期票。






