Z.ai把GLM-5.3叫做「最具能力的开源coding模型」,但翻开它自己贴出的跑分表,故事没那么干脆。在Terminal Bench 3.0上,GLM-5.3拿下28.3分,输给闭源的Claude Fable 5(33.7)和GPT-5.6 Sol(34.6);在处理真实GitHub issue的DeepSWE v1.1测试里,它的66.9分也不敌开源同行Kimi K3的67.5,以及Fable 5的69.7。一份用来证明自己最强的官方文档,反而把「不是最强」写得很清楚。

GLM-5.3是在周四透过GLM Coding Plan订阅与ZCode上线的,API和可下载的权重要等安全审查后分阶段发布。这颗模型有743亿参数,是在GLM-5.2的底座上持续扩大post-training训练量做出来的——Z.ai在发布文里的说法是「Scaling post-training is all we did for GLM-5.3」,过去一个月加了更多环境、更多样的任务,以及更多算力。

这次的重点不是把分数往上堆,而是省token。在Z.ai自家的Code Bench测试里,GLM-5.3在Max effort下拿到34.5%,平均每个任务烧掉约75,000个输出token;GLM-5.2则是23.4%,却要烧到96,000个token。换句话说,新模型分数涨了、油耗反而降了。跟Claude Opus 4.8比,Z.ai说GLM-5.3的token经济性更好,但一样承认「remains behind Claude Fable 5, which reaches 39.5% at Max effort」——这句话是自己写在博客里的。

真正的亮点在资安测试。GLM-5.3在CyberGym拿下84.5%,在漏洞挖掘类的benchmark上分数是GLM-5.2的两倍以上。Z.ai表示这颗模型在269个开源项目里揪出2,436个漏洞,其中1,097个被判定为中高风险。这是这次发布里少数没有被自己数据打脸的部分。

价格是开源模型还能打的地方。GLM-5.2的官方API报价是每百万token输入1.40美元、输出4.40美元,Z.ai说整体API定价大约是美国前沿模型的十分之一。对比之下,GPT-5.3-Codex是1.75美元进、14美元出,Claude Opus 4.8的定价更是站在Anthropic价格表的最顶层。GLM Coding Plan本身走点数额度制,离峰时段用量还打对折。

「open-weights」这个标签,目前其实还没兑现。发布文里写得清楚,权重要再过大约两周才会公开发布,现在能用的是订阅制的GLM Coding Plan和ZCode,不是能下载回家跑的文件。Z.ai是被列入美国Entity List的北京实验室,美国公司不能对它出口受管制技术——即便如此,中国的开源模型在OpenRouter上的token使用量已经超过美国同类模型,GLM系列本身也相当受欢迎。

总结这份自曝其短的公告:GLM-5.3打赢了自己的上一代,也赢过部分开源对手,但在最显眼的coding榜单上,闭源的美国前沿模型还是站在前面,而它引以为傲的「开源」,此刻仍是一句期票。