神秘「牛来」模型果然是智谱:GLM-5.3 Flash 首个原生多模态,全跑国产卡
2026-09-02 · AI 科技洞察 · 聚焦 量子位
导语:此前在海外爆火的匿名模型「牛来」(Ox Alpha)真身曝光,为智谱开源发布的 GLM-5.3 Flash。总参数 320B、激活 18B,在 AA 综合智能指数取得 57 分与 Claude Opus 4.8 持平;架构采用线性+稀疏混合注意力,定价仅为 Opus 4.8 的 1/40。匿名测试期 62T Token 调用全部由国产芯片承接。
图片来源:量子位
前几天在网上炒得沸沸扬扬的神秘模型「牛来」(Ox Alpha),真身终于曝光——果然是来自中国玩家智谱,刚刚发布即开源的 GLM-5.3 Flash,还是 GLM 5 系列里首个原生多模态的版本。
「牛来」在火的这几天里,其实已经有不少人用 Ox Alpha 在实测了。比如博主 Tim Jayas 用同样的 Prompt 让「牛来」做了两次 SpaceX Raptor 猛禽发动机 3D 交互网页后,感慨「感觉『牛来』是一个能自己持续学习的模型」。在我们拿到 GLM-5.3 Flash 内测资格做同款任务时,输入完 Prompt 之后全程无需任何操作,等候片刻 3D 猛禽引擎项目就出炉了。
为什么「牛来」会这么火?单单是从各大官方帖子中就能窥知一二:在 OpenRouter 上,「牛来」首日便冲上榜首,刷新单日 tokens 用量历史纪录;OpenCode 则表示 Ox Alpha 一出世即终结了 DeepSeek 在 OpenCode 连续 56 天霸榜的纪录。
智谱正式认领后,我们发现 GLM-5.3 Flash 还有更多亮点。在模型尺寸方面,GLM-5.3 Flash 仅为 320B,但在能力上全面超越了体量 753B 的 GLM-5.2。根据最新 AA 榜单,GLM-5.3 Flash 已拿下 57 分,放眼全球范围内已然是步入前沿之列,并且与 Claude Opus 4.8 得分持平。价格方面,GLM-5.3 Flash 的定价是 GLM-5.3 版本的 1/10、Opus 4.8 的 1/40——这意味着开发者调用成本急剧下降。
还有一件值得骄傲的事——上面提到的 62T Tokens 都跑在国产卡上。原来老外追了一个月的「神秘模型」,是头纯血国产牛。
架构层面,GLM-5.3 Flash 是 GLM 系列首个原生多模态模型。智谱专门为 Visual Coding 做了数据合成流水线,让模型在执行任务过程中能够自己去看最终页面、交互和 3D 场景,再根据视觉反馈继续修改——这就是为什么在设计稿还原、3D 建模这类任务里,它能一边写、一边看、一边继续改。
架构上的关键创新在于注意力机制的改造。GLM-5.3 Flash 采用了线性注意力+稀疏注意力的混合架构:线性注意力负责抓住局部信息,稀疏注意力通过一个轻量级索引器把真正相关的全局上下文捞回来。面对 1M 这样超长的上下文,它不用让所有 Token 都彼此狠狠干一遍计算。智谱还加了一个 IndexPool,把索引器原本 4 个缓存向量压成 1 个——相比 GLM-5.3,注意力计算量降低了 3.01 倍,KV Cache 缩小了 4.44 倍。
为了让 GLM-5.3 Flash 跑得动国产加速芯片,智谱把多模态编码、Prompt 预填充和逐 Token 解码拆成可独立调度、扩缩容的 Encode-Prefill-Decode 分离式架构,同时叠上 Layer Split、混合缓存量化等一系列底层优化。最终相比同一硬件上的初始基线,端到端服务性能提升 3 倍,单 Token 成本也做到了与主流英伟达 GPU 相当的水平。
回头看「牛来」这几天在海外突然爆火,味道其实就不太一样了。在正式认领之前,OpenRouter 和 OpenCode 上的海外开发者压根不知道 Ox Alpha 是谁家的——大家就是觉得好用,然后一轮又一轮 Prompt 往里塞,硬生生把它用到了榜一。结果等智谱把牌翻开,才发现还有后半截:模型是国产的,连背后接住这波全球真实流量的算力,也是国产的。
过去前沿模型有个越来越现实的问题:能力越来越强,调用起来也越来越贵。尤其 Agent 开始真正干活之后,一次任务跑几十分钟、几个小时,Token 像开了水龙头一样往外流。GLM-5.3 Flash 把架构、推理和算力效率继续往下抠,再把前沿能力的价格一起打下来:AA 拿到 57 分与 Opus 4.8 持平,价格却只有后者的 1/40。前沿模型终于开始有了点「日常消耗品」的意思。
最后还有开源。GLM-5.3 Flash 已正式面向全球开源,同时接入 Z Code、开放 API。模型能跑在国产芯片上,权重又直接打开,开发者拿得到,企业也有机会自己部署。模型、国产算力和开源生态,这一次算是真正接到了一起。
关键要点
- 总参数 320B、激活 18B,AA 智能指数 57 分与 Opus 4.8 持平
- 线性+稀疏注意力混合架构,注意力计算量降 3.01 倍,KV Cache 缩 4.44 倍
- 定价为 GLM-5.3 的 1/10、Opus 4.8 的 1/40
- GLM 5 系列首个原生多模态,支持 Visual Coding
- 匿名测试期 62T Token 全部由国产芯片提供算力
📎 本文由 AI 自动采集整理,编译自 量子位(2026-08-27)。
原文版权归原作者所有,本文仅用于信息聚合参考。
来源与版权
本文由 AI 自动采集整理,内容来源于 量子位。
版权声明:本文仅作信息聚合参考,版权归原作者所有。如有异议请联系 [email protected]。
发布方:Tiqex · 2026-09-02