Z.ai把GLM-5.3叫做「最具能力的开源coding模型」,但翻开它自己贴出的跑分表,故事没那么干脆。在Terminal Bench 3.0上,GLM-5.3拿下28.3分,输给闭源的Claude Fable 5(33.7)和GPT-5.6 Sol(34.6);在处理真实GitHub issue的DeepSWE v1.1测试里,它的66.9分也不敌开源同行Kimi K3的67.5,以及Fable 5的69.7。一份用来证明自己最强的官方文档,反而把「不是最强」写得很清楚。
GLM-5.3是在周四透过GLM Coding Plan订阅与ZCode上线的,API和可下载的权重要等安全审查后分阶段发布。这颗模型有743亿参数,是在GLM-5.2的底座上持续扩大post-training训练量做出来的——Z.ai在发布文里的说法是「Scaling post-training is all we did for GLM-5.3」,过去一个月加了更多环境、更多样的任务,以及更多算力。
这次的重点不是把分数往上堆,而是省token。在Z.ai自家的Code Bench测试里,GLM-5.3在Max effort下拿到34.5%,平均每个任务烧掉约75,000个输出token;GLM-5.2则是23.4%,却要烧到96,000个token。换句话说,新模型分数涨了、油耗反而降了。跟Claude Opus 4.8比,Z.ai说GLM-5.3的token经济性更好,但一样承认「remains behind Claude Fable 5, which reaches 39.5% at Max effort」——这句话是自己写在博客里的。






