前几天 OpenRouter 上出现了一个匿名模型 Ox Alpha,免费开放,五天流量累积超过 50T,刷新了平台历史纪录的四倍。全网都在猜它是谁。Gemini 团队的人跑来认领,说是自家的。结果谜底揭晓:智谱,GLM-5.3 Flash。
这件事本身就很有意思。一个中国公司的模型,匿名扔到海外平台上,不靠品牌、不靠营销,纯粹凭实力把流量吸干。这说明什么?说明模型能力到了某个阈值之后,开发者是用脚投票的,他们不在乎你叫什么名字。
一个轻量模型凭什么打旗舰
GLM-5.3 Flash 的参数量是 321B,大概是自家 GLM-5.3 的 40%。按照过去的经验,小模型通常是从大模型蒸馏出来的,能力打个折扣,价格便宜点,各取所需。但智谱这次走了一条不同的路:完全重新设计架构,底层的混合注意力机制整个重写。

具体来说,每次激活的参数从 32B 砍到 18B,层数几乎减半。局部依赖交给线性递归处理,全局上下文用轻量级索引器去捞,再加上一个叫 IndexPool 的池化技术把缓存向量压缩。整套操作下来,注意力计算量降了三倍,KV 缓存降了四倍多。

结果就是:智谱内部评测,GLM-5.3 Flash 的 Artificial Analysis Intelligence 分数是 57 分,超过了上一代旗舰 GLM-5.2,和 Claude Opus 4.8 持平,比 DeepSeek V4 Pro 正式版的 53 分还高。一个轻量级模型,智能水平摸到了顶级旗舰的天花板。

而它的价格是:输入 0.8 元,输出 2.8 元,每百万 token。上线前两周半价。对比 Claude Opus 4.8 海外输出价格 25 美元,GLM-5.3 Flash 海外输出价格 0.5 美元。四十分之一。
同时,GLM-5.3 Flash 支持多模态了,智谱这一点让我很欣慰啊。
DeepSeek 涨价撕开的口子
要理解这件事的意义,得先看背景。
八月份 DeepSeek 全面涨价。V4 Pro 从 6 元涨到 13.5 元,高峰 27 元;V4 Flash 输出从 2 元涨到 4.5 元,高峰 9 元。官方理由是算力稀缺,长期低价侵蚀现金流。梁文锋之前说过“智能需求没有弹性”,但市场给出了不同的答案:涨价后,OpenCode 上 DeepSeek V4 Flash 的调用量直接掉了一半。
需求当然有弹性。特别是轻量级旗舰这个区间,用户对能力有底线要求,但在底线之上,价格敏感度极高。DeepSeek 涨价等于主动让出了一块市场,而智谱精准地切了进来。
综合输入输出成本,GLM-5.3 Flash 在绝大多数常规调用场景下比涨价后的 DeepSeek V4 Flash 更便宜。考虑到它的智能分数还更高,这个性价比几乎是碾压级的。
国产芯片的一次硬核证明
还有一个容易被忽略的细节:Ox Alpha 匿名测试期间那恐怖的全球流量,全部由国产芯片集群承接。10 万张以上的国产卡,算力供应商据悉来自华为、摩尔线程与海光。
智谱在技术文档里说,集群的硬件效率和单位 token 成本已经达到了主流英伟达 GPU 相当的水平。这句话如果属实,意味着国产算力在大规模推理场景下已经不再是“能用但贵”或“能用但慢”的状态,而是真正具备了商业竞争力。
更有意思的是,智谱在构建这套国产卡集群的过程中,让 GLM-5.3 驱动的基建智能体去帮忙优化算子、诊断性能瓶颈。大模型帮着优化自己要跑的系统,这个正向循环一旦跑通,后续的迭代速度会越来越快。
轻量旗舰赛道的终局猜想
我的判断是:轻量旗舰模型正在成为 AI 行业真正的主战场。
顶级旗舰模型的能力天花板还在往上走,但大多数实际应用场景需要的是“够用的智能加上足够低的成本”。当轻量模型的智能水平已经能和上一代甚至同代旗舰持平,价格却只有十分之一到四十分之一,理性的开发者没有理由不迁移。
我感觉在国内市场,这个趋势会更加剧烈。模型选择多、能力差距小,厂商不仅要和同行竞争,还要面对开源部署和云厂商赠送额度的压力。模型很难作为稀缺品定价,更接近标准云服务。谁能在这个区间里做到能力最强、成本最低、生态最开放,谁就能吃下最大的调用量。
智谱这次的动作,时机、产品、定价都卡得很准。但这只是开始。DeepSeek 涨价撕开的口子,不会只有智谱一家看到。接下来几个月,这个赛道会挤满玩家。对开发者来说,这当然是好事。对模型公司来说,真正的淘汰赛才刚刚开始。