GLM-5.3-Flash 详解:匿名的 Ox Alpha 是智谱,价格是 GLM-5.3 的十分之一
8 月 20 日,OpenRouter 上出现一个不写厂商名的模型 stealth/ox-alpha:100 万上下文、收文本图像视频、限时免费。 六天后智谱认领,它叫 GLM-5.3-Flash,320B 总参数 / 18B 激活,MIT 开源。这篇讲清楚社区是怎么把它认出来的、它到底是什么模型、以及按你的账单算值不值得换。
一、先看结论
智谱 8 月 26 日发布并开源的 GLM-5 系列首个原生多模态模型,走 MoE 路线,320B 总参数、18B 激活。 权重以 MIT 协议放在 Hugging Face,商用、修改、再分发都没有附加条件,SGLang、vLLM、TokenSpeed、KTransformers 可直接跑。
把编程和 Agent 这类高频、长上下文、吃 token 的活儿,从每百万输入 1.4 美元的 GLM-5.3 挪到 0.075–0.15 美元这一档, 同时保留 100 万上下文和原生看图/看视频的能力——模型可以直接读界面截图、渲染结果和交互反馈,不用先转成文字描述。
每天几千万 token 起步的 Agent 编程、批量文档处理、长上下文检索这三类场景,价格差一个数量级会直接改写月度账单。 对话类轻量应用差别没那么大,可以先不动。
注:下文标注「官方」的基准分和价格来自智谱发布材料,标注「站内数据」的来自 TrakToken 每日同步的价格与智能指数表。两者口径不同,混着看之前请先看清标注。
二、Ox Alpha 那六天:从匿名上线到被认出来
厂商拿匿名代号在第三方平台放模型做灰度测试,这几年已经是常规操作。这次值得记一笔的是社区把它扒出来的方法。
| 8 月中旬 | 智谱发布 GLM-5.3(站内数据记为 8 月 18 日上线,输入 $1.4 / 输出 $4.4,智能指数 59.5)。这一版是纯文本模型。 |
| 8 月 20 日 | OpenRouter 目录里多出 stealth/ox-alpha: 1,048,576 上下文、131,072 最大输出、接受文本 / 图像 / 视频,输入输出价格都标 0。同期它也在 OpenCode 上接受测试。 |
| 8 月 21 日前后 | 有独立测试者从 DeepSWE 抽了 10 道真实软件工程题,Ox Alpha 过 8 道(80%),同批次 Claude Fable 5 为 65%、GPT-5.6 Sol 为 52%。 这是十题量级的社区小样本,不是官方榜单成绩。 |
| 溯源 | 三条独立证据同时指向智谱,见下方。中文社区顺着 ox 给它起了个名字:牛来。 |
| 8 月 26 日 | 智谱正式发布 GLM-5.3-Flash,并确认它就是此前匿名测试的 ox-alpha。 |
社区用的三条证据
用 30 条风格各异的 prompt 分别喂给 Ox Alpha 和 GLM-5.3,统计 token 数。两边差值恒定为 75 个 token—— 说明底层用的是同一套分词器,那 75 个 token 是系统提示词之类的固定开销。
抽帧策略等三个独立参数上,Ox Alpha 的视频处理行为与智谱此前的 GLM-5V-Turbo 完全一致。
一个畸形请求让服务端吐出了 Java 堆栈,包名指向智谱内部 API,错误码格式和 Z.ai 托管的 GLM 模型一模一样。这条最直接。
当时留下的疑点是:GLM-5.3 是纯文本的,Ox Alpha 却能收图像和视频。所以社区推断它是一个还没发布的多模态版本, 并且在智谱开口之前几天就把「GLM-5.3 Flash」这个名字叫了出来。结果猜对了。
三、GLM-5.3-Flash 是什么:架构与规格
| 参数规模 | 320B 总参数 / 18B 激活,45 层 MoE |
| 注意力 | GLM 系列首次把线性注意力和稀疏注意力混合使用:线性注意力用状态建模处理近距离依赖,稀疏注意力靠轻量索引器做远距离检索 |
| IndexPool | 把索引器原本 4 份 index key 向量加权池化压成 1 份,约 4:1 |
| 相比 GLM-5.3 的开销 | 注意力计算量降约 3.01 倍,KV Cache 占用降约 4.44 倍(官方数据) |
| 上下文 / 输出 | 100 万 token 上下文,最大输出 128K |
| 预训练 | 约 30T token 多模态语料,原生多模态而非后接视觉模块 |
| 许可与权重 | MIT,Hugging Face 上 FP8 权重约 328GB / 62 个文件,SGLang、vLLM、TokenSpeed、KTransformers 开箱可跑 |
| 推理硬件 | 公测流量全部跑在国产 AI 芯片集群上,基于 SGLang 自研推理引擎,官方称端到端服务性能提升 3 倍 |
这套架构要解决的是同一件事:把 100 万上下文的服务成本压下去。注意力计算量和 KV Cache 是长上下文推理里最贵的两块, 官方给的 3.01 倍和 4.44 倍降幅,最终体现在了那个十分之一的定价上。
四、能力:官方基准与多模态表现
下面这组数字来自智谱发布材料,纵向对比 GLM-5.2 和 Claude Opus 4.8。Z.ai Code Bench 是自研评测,参考价值有限,这里不列。
| 基准 | GLM-5.3-Flash | GLM-5.2 | Opus 4.8 |
|---|---|---|---|
| DeepSWE v1.1(软件工程) | 63.4 | 46.2 | 58.0 |
| Terminal-Bench 2.1(终端操作) | 84.3 | 81.0 | — |
| Toolathlon Verified(工具调用) | 78.4 | 57.4 | 76.2 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | — |
| HLE(人类最后一场考试) | 55.3 | — | — |
几个可以记住的点:工具调用和自动化任务的涨幅最大, Toolathlon 从 57.4 到 78.4、AutomationBench 从 26.2 到 48.8,都接近翻倍。这两项直接对应 Agent 能不能连续跑完一条长链路。 DeepSWE 上它比 Opus 4.8 高 5.4 分,Toolathlon 高 2.2 分。
多模态部分
| MMVU(视频理解) | 80.5 |
| MVBench | 77.8 |
| Chartography with Tools(图表) | 78.0 |
| OfficeQA Pro(办公文档) | 62.4 |
原生多模态在编程场景里的实际用法是:让模型直接看渲染出来的页面截图、看报错弹窗、看图表,然后决定下一步改哪行代码。 此前这条链路要先接一个视觉模型把画面转成文字,再交给编程模型,中间损失的信息不少。
五、价格:按每百万 token 逐项核对
官方口径是「GLM-5.3 的 1/10,限时折扣期 1/20,Opus 4.8 的 1/40」。我们按站内价格表逐项算一遍。
| 模型 | 输入 $/1M | 输出 $/1M | 智能指数 |
|---|---|---|---|
| GLM-5.3-Flash(促销,至 9 月 9 日) | 0.075 | 0.25 | 57 (官方) |
| GLM-5.3-Flash(标准价) | 0.15 | 0.50 | 同上 |
| GLM-5.3 | 1.40 | 4.40 | 59.5 |
| GLM-5.2 | 1.40 | 4.40 | 52.6 |
| GPT-5.6 Luna | 0.20 | 1.20 | 52.3 |
| Claude Sonnet 5 | 2.00 | 10.00 | 55.3 |
| Claude Opus 4.8 | 5.00 | 25.00 | 57.3 |
| Claude Opus 5 | 5.00 | 25.00 | 63.1 |
| GPT-5.6 Sol | 4.00 | 20.00 | 60.9 |
GLM-5.3-Flash 一行为官方公布价,缓存命中输入 $0.015/1M;其余为站内每日同步数据,取满推理档。智能指数为 Artificial Analysis 口径。
按标准价逐项算:输入 5.00 ÷ 0.15 ≈ 33 倍,输出 25.00 ÷ 0.50 = 50 倍。促销价则是 67 倍和 100 倍。 官方的 1/40 是输入输出混合后的口径,落在这个区间里,不算夸大。你自己算的时候按实际 input/output 比例套。
同价位段里,Luna 是 $0.20 / $1.20、智能指数 52.3。GLM-5.3-Flash 标准价 $0.15 / $0.50,官方智能指数 57。 输出价便宜一半以上,指数还高约 5 分。Agent 场景输出 token 占比高,这个差距会被放大。
GLM-5.3 智能指数 59.5,比 Flash 高 2.5 分,价格贵约 9 倍。日常编程、工具调用、长文档走 Flash; 留一条 GLM-5.3 或更强模型的通道,处理 Flash 跑不动的复杂推理和数学题。
六、GLM 家族这一年:从 4.5 到 5.3-Flash
下表全部来自站内每日同步的价格与指数记录,可以看出智谱的更新节奏:一年出了九代,最近半年缩到平均六到八周一版。
| 模型 | 上线 | 参数 | 输入 $ | 指数 |
|---|---|---|---|---|
| GLM-4.5 | 2025-07-28 | 355B / 32B | — | 19.7 |
| GLM-4.6 | 2025-09-30 | 357B / 32B | 0.55 | 29.3 |
| GLM-4.7 | 2025-12-22 | 357B / 32B | 0.60 | 34.5 |
| GLM-4.7-Flash | 2026-01-19 | 31.2B / 3B | 0.07 | 23.3 |
| GLM-5 | 2026-02-11 | 744B / 40B | 1.00 | 40.6 |
| GLM-5.1 | 2026-04-07 | 744B / 40B | 1.39 | 41.0 |
| GLM-5.2 | 2026-06-16 | 753B | 1.40 | 52.6 |
| GLM-5.3 | 2026-08-18 | — | 1.40 | 59.5 |
| GLM-5.3-Flash | 2026-08-26 | 320B / 18B | 0.15 | 57 (官方) |
GLM-4.7-Flash 是 31.2B 总参数、3B 激活的小模型,指数 23.3,比同代旗舰低 11 分,属于降规格换低价。 GLM-5.3-Flash 是 320B 总参数、18B 激活,指数只比 GLM-5.3 低 2.5 分。现在的 Flash 指的是低激活比例带来的低服务成本,跟模型体量小不是一回事。 这也意味着本地部署门槛没有跟着降——FP8 权重约 328GB,仍然是集群级别的活儿。
GLM-5 系列从 744B / 40B 激活起步,5.3-Flash 是 320B / 18B。总参数少了一半多,指数反而从 40.6 涨到 57。 这一年智谱在做的事,是把同样的能力塞进更少的激活参数里。
4.5、4.6、4.7、4.7-Flash、5、5.1、5.2 都放了权重,5.3-Flash 直接用 MIT,比此前的定制协议更宽松。 想看开源模型全景可以去 开源模型部署选型。
七、几个需要提醒的地方
Ox Alpha 匿名免费期间保留了全部提交的 prompt,而它在 OpenRouter 上的 listing 条款和 OpenRouter 自身的 EULA 对留存的描述并不一致, 提交的代码会不会进入后续训练,公开信息里查不到确定说法。结论很简单:任何标着 stealth 的免费入口,都不要接生产代码和客户数据。
早期实测反馈里,逻辑推理和数学计算是它相对更大模型的弱项;KernelBench-Mega 上强于 GLM-5.2、弱于 GLM-5.3。 问答、文本生成、常规代码辅助够用,把它当成全场景替代品会踩坑。
上面那张基准表来自智谱发布材料。AA 智能指数 57 分也是官方引用,站内数据表里还没有 GLM-5.3-Flash 这一行—— 我们的价格与指数由上游数据源每日同步,新模型接入需要几天。等它进表之后,智谱 Z.ai 报价页 会自动更新。
$0.075 / $0.25 是限时价,之后翻倍到 $0.15 / $0.50。做成本模型的时候按标准价算,别把促销价写进长期预算。
八、你现在可以做的几件事
| 先算账再动手 | 拿你上个月的 input / output token 量,按标准价 $0.15 / $0.50 算一遍,和现在用的模型对比。成本计算器 支持直接填月度用量。 |
| 分流,别一次全换 | 编程、工具调用、长文档走 Flash;数学和复杂推理保留原模型。用路由规则分,观察两周再决定比例。 |
| 把缓存打开 | 缓存命中输入 $0.015/1M,是标准输入价的十分之一。Agent 场景系统提示词和代码库上下文重复率高, 这一项对账单的影响可能比换模型本身还大,参考 缓存命中价的时间线那篇。 |
| 要自己部署的话 | MIT 权重在 Hugging Face,FP8 约 328GB。先在 开源模型页 对一下显存和硬件账, 多数团队算完会发现调 API 更划算。 |
| 横向比一比 | GLM-5.3 vs GLM-5.2 vs GPT-5.6 Luna vs Claude Sonnet 5,按你的真实场景参数看月度成本。 |
本文整理自智谱发布材料、OpenRouter 公开目录与社区溯源记录,价格与智能指数部分来自 TrakToken 每日同步的数据。 可以和 国内大模型 API 价格对比、2026 API 定价总览 对照阅读。
纠错与补充欢迎通过页面右下角的「反馈」入口告诉我们。联系:hi@kuhung.me。