GLM-5.3-FlashX:快5倍,贵2.5倍
八月里有一周,一个不知名的模型出现在开发者使用的两个服务上,免费,没有制造商名称,使用 Ox Alpha 这个化名。大家只能在不知道它是谁的情况下测试它。它成了那两个平台上本周使用最多的模型。几天后,有人仅仅通过观察它如何把文本切成小块,就猜出了它来自哪个家族,之后 Z.ai 才确认并发布了权重。
它就是 GLM-5.3-Flash,而这场小游戏并不是一时兴起:这家公司想要得到那些不会对品牌抱有先入之见的开发者反馈。干得漂亮。周五,同一家公司又往机器里投了一枚硬币,推出了一个速度快五倍、价格贵两倍半的版本。
周五公布了什么
这个新来的家伙叫 GLM-5.3-FlashX。公告里有两个数字,而且它们朝着相反的方向走。先说速度:最高每秒 200 个令牌,而 Flash 版本大约是 45 个。快了五倍。再说价格:输入价格变成每百万个令牌 0.37 美元,而 Flash 是 0.15 美元。输出则是 1.25 美元对 0.50 美元。总之,整个价格表都套用了同一个 2.5 倍系数。
简单说,一个令牌就是一个词的一小块。你可以把它大致算成一个常见法语词的四分之三。所以一百万个令牌大约就是 750,000 个词,也就是两本大部头小说,只要几十美分。
一个没有标签的盒子放在架子上。整整一周,所有人都在不知道是谁制造它的情况下测试了它
把价格放在一起看
同一家制造商的一百万个令牌的输入价格,2026年9月18日
Z.ai 的完整表格很有启发,因为它说明这家公司并不满足于只提高一个价格:它又搭了一层。底部是输入价格为 0.15 美元的 GLM-5.3-Flash。中间是新的 FlashX,价格为 0.37。顶部是完整模型 GLM-5.3,输入价格为 1.40 美元,输出价格为 4.40 美元,也就是 FlashX 价格的将近四倍。
需要看的不是表面数字,而是机器花多少钱来完成工作。在 Artificial Analysis 的指数上,这个指数综合衡量推理、代码和知识,GLM-5.3-Flash 得到 57 分,在所有模型中排名第三,每项任务的成本是 0.09 美元。Claude Opus 4.8 开到最大思考程度时,得分大致相同,但每项任务要花 2.03 美元。这才是真实的差距:大约二十倍,不是有时能读到的 40 倍。至于 FlashX,价格是 Flash 的 2.5 倍,却仍然远远落后。
底下到底是什么在运转
对于这个档次的模型来说,技术规格很让人意外。总共 3200 亿个参数,但每生成一个词只激活 180 亿个。原理就是专家混合:机器手头留着几十个专家,只唤醒 288 个可用专家中的八个,来处理眼下这段文本。因此,虽然标示出来的规模大得吓人,账单仍然很低。
它也是这个家族里第一个真正能看东西的模型:文本、图片和视频进入同一个模型,一次最多输入一百万个令牌。这和把一个图像读取器粘在文本模型旁边的临时拼装相去甚远。
还有一个细节,美国人比我们更早注意到:在整整一周的免费测试期间,这个模型完全运行在中国制造的芯片上。里面没有一块 Nvidia 加速器。对于一个质量达到这种程度、又同时免费服务数千名开发者的模型来说,这既是一场展示,也是一份公告。
这会怎样改变你的账单
如果你从来不用编程接口来调用模型,这个消息就不会直接影响你,我还是更愿意把这点说清楚。下降的是按量计费的价格,不是订阅价格。
至于其他人,影响很简单,而且月底就能看出来。一个替你整理邮件、总结会议,或者整晚帮你检查代码的代理,会持续消耗令牌,而令牌的价格决定了你是让它继续运行,还是把它关掉。把账单减少二十倍,会彻底改变我们敢于启动什么。我自己的使用方式大概就是这样:我让 Claude Code 整天运行,月底配额消耗得太快时,我有时会切换到 GLM。
在你睡觉时工作的代理。它不是免费的,只是已经便宜到让人不再去想这件事了
不过还是要当心这类宣传会设下的一个陷阱。模型快一点当然好,但速度也要付出校对的代价。每秒 200 个 token 时,机器生成的速度比你阅读的速度快,更比你检查的速度快得多。放到代码上,这意味着错误会成堆出现,而校对会变成真正的瓶颈。
仍然模糊的地方,而且这并不是什么小事
资料页没有说三件事。知识截止日期没有公布,训练数据的来源也没有公布,这几乎是所有人的惯例,但每次都值得说出来。其次,权重可以在 MIT 许可证下免费下载,但完整版本 GLM-5.3 加了一条规定:营收超过 100 亿美元的企业,在使用它之前必须通过安全审查。这不是自由软件的末日,这是市场顶端提出的一项条件。
最后,数据里还有一个有趣的反差。FlashX 的速度是 Flash 的五倍,但完整模型 GLM-5.3 的实际吞吐量仍然比 FlashX 更快,每秒 78 个 token,对比每秒 45 个。宣传中的峰值速度和你在自己的请求上获得的速度不是一回事。所有模型都这样,只是当你把同一个模型的三个版本叠在一起时,这一点会更加明显。
真正的问题不是价格
两年来,中国模型的承诺都可以概括成一句话:同样优秀,便宜得多。这是真的,现在依然如此,而现在他们又在上面加了一层,并且把它定价成下面那层的近三倍。
应该这样理解:他们靠价格打进来,现在想让别人为其他东西付钱。Z.ai 从今年起就在股市上市,筹集了数十亿美元,也不再需要靠压低价格来证明自己的存在。这正是 OpenAI 在它之前做过的事,也是一个品类正在成长的信号。
不过,那个曾经用来展示实力的免费 Flash 仍然保持着输入每次 0.15 美元的价格。如果没有人从更低的价位来和它竞争,这还能持续多久?



加入对话
您必须拥有一个账户才能评论这篇文章。注册免费,耗时不到一分钟。
目前没有评论。