“牛来”模型被智谱认领!价格大跳水,10万张国产芯片承载

南都N视频APP · 政商数据
原创2026-08-27 13:46

紧随阿里巴巴,智谱也于8月26日晚深夜上线并开源GLM-5.3-Flash模型。该模型此前已在OpenRouter、OpenCode上匿名爆火、被网友戏称为“牛来”模型。值得一提的是,该模型对比智谱上一代模型价格直线下降,同时其在指数测评上分数与Anthropic的Claude Opus 4.8相等,但定价仅为Opus 4.8的1/40。同时,智谱方面透露,GLM-5.3-Flash全部线上流量均由10万张国产芯片承载,这也是国产算力芯片首次大规模集体“出海”。

据介绍,GLM-5.3-Flash是智谱GLM系列首个原生多模态模型,该模型采用稀疏注意力与线性注意力混合架构,擅长处理Coding与Agent任务。正式发布前,该模型以匿名身份(Ox Alpha)在OpenRouter、OpenCode两大海外模型调用平台测试,迅速登顶并刷新双平台历史纪录,单日处理tokens达62T。

图片

OpenRouter调用量登顶。

匿名发布模型测榜随后认领,正在成为模型厂商“制造惊喜”的手法。就智谱而言,这也不是其第一次以匿名形式发布新模型,今年春节前夕OpenRouter上出现一个名为Pony Alpha的模型,因性能突出被业界竞猜来自哪一家国产模型厂商,后来被证明是智谱的GLM-5模型。

值得一提的是,该模型也加入了模型价格战序列。比如,GLM-5.3-Flash在基准测试与真实使用中全面超越了参数量高出一倍的智谱上一代旗舰GLM-5.2,但定价却仅为后者的1/10。在独立AI模型与API分析平台的‌Artificial Analysis榜单上,GLM-5.3-Flash分数与Claude Opus 4.8相等,但当前价格仅为Opus 4.8的1/40。

支撑这一价格的是模型架构层面的重构。据介绍,GLM-5.3-Flash采用稀疏注意力与线性注意力混合架构,线性注意力以递归机制捕获局部依赖。与GLM-5.3相比,其注意力计算量与KV缓存(Key-Value Cache,一种缓存优化技术)分别降低3.01倍与4.44倍,这意味着省掉了模型将近67%的运算量和超过77%的显存开销。

与此同时,智谱方面透露,GLM-5.3-Flash全部线上流量均由10万张国产芯片承载,正式发布前,该模型以匿名身份在OpenRouter等海外平台测试,迅速登顶并刷新双平台历史纪录,Token调用量高达62T,这是国产算力芯片首次大规模集体“出海远征”,直接服务全球真实负载。

采用模型架构和训练的革新,国产大模型正在掀起新一轮价格战。8月26日晚,阿里发布并同步开源千问最新模型Qwen3.8-Flash。该模型采用全新下一代架构,千亿总参数仅激活60亿(6B)即可获得超越Claude Opus4.6的前沿性能,训练成本较前一代模型Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低为DeepSeek-V4-Flash的1/3。

而从模型架构和训练方法上去革新,继而推动最小化单位的智能成本,也正在成为模型行业的一大共识。MiniMax创始人、CEO闫俊杰8月26日晚也在财报电话会上表示,AI真正的长期竞争,不只是把模型做得更强,而是能不能用更低的成本把更高水平的智能提供给更多人。

他进一步提到,下一阶段的竞争核心是选择有效的技术路径并持续提高把算力转化为智能的效率。“模型智能的提升,不只是简单地把模型参数规模做得更大,而是要把架构设计、训练、强化学习、推理、评测以及Agent环境等各个环节更好地连接起来。基础设施也不只是拥有更多算力,还要让集群运行得更稳定、训练和推理更高效,能够持续产生和回收高质量数据,并支持更大规模的实验和强化学习。”

采写:南都N视频记者 林文琪

编辑:马宁宁

南都N视频,未经授权不得转载、授权联系方式
banquan@nandu.cc. 020-87006626