快速回答: 这场对决其实不存在——Ox Alpha 和 GLM 5.3 Flash 是同一个模型。 Ox Alpha 是 Z.ai 在 OpenRouter 上从 2026 年 8 月 20 日到 26 日使用的匿名代号;8 月 26 日公司确认了这件事,并以 GLM-5.3-Flash 的名义正式发布。但围绕这份完全相同的权重,条款彻底变了:模型 ID 从 stealth/ox-alpha 变成 z-ai/glm-5.3-flash,价格从 $0 变成标价 $0.15/$0.50,单一匿名 provider 变成 十家实名 provider,此前不存在的 MIT 开源权重出现了。如果你曾经对着 Ox Alpha 做过集成,你有一次迁移要做。
这个对比之所以存在,是因为成千上万的人在搜它,而几乎每一个回答它的页面都停在"同一个模型"——这句话正确、无用,并且留给你一个坏掉的集成。有用的问题不是哪个更好,而是你测试过的那个预览版,和你现在要为之付费的那个产品之间,到底变了什么,以及你在那个免费周里跑出来的结论,今天还成不成立。
下面的来源是 Z.ai 的发布公告、OpenRouter 模型页及其 endpoints API(查询于 2026 年 8 月 27 日)和 Hugging Face 模型卡。潜行周的社区说法均标注为社区来源,不用于支撑任何技术事实。
这篇文章解决什么问题
痛点:你一周的评估笔记,归档在一个已经不存在的模型名下。 团队免费测了 Ox Alpha、觉得不错、写进了流水线——然后端点的名字、价格、provider 集合和数据政策同时改变,而且没有任何弃用缓冲期,因为那个预览从来就不是一个受支持的产品。
读完你会拿到一份精确的前后对照表、要改的具体代码,以及一个诚实的回答:那个付费模型,还是不是当初那个免费模型给你的感觉。
同一份权重,不同的条款
| Ox Alpha(预览期) | GLM 5.3 Flash(正式版) | |
|---|---|---|
| 时间 | 2026 年 8 月 20–26 日 | 2026 年 8 月 26 日起 |
| OpenRouter 模型 ID | stealth/ox-alpha | z-ai/glm-5.3-flash |
| 厂商 | 未披露 | Z.ai(智谱 AI) |
| Provider 数 | 1 家(匿名 "Stealth") | 10 家实名 provider |
| 价格 | $0 / $0 | 每 100 万:输入 $0.15 / 缓存 $0.03 / 输出 $0.50(标价) |
| 开源权重 | 无 | MIT,zai-org/GLM-5.3-Flash |
| 架构披露 | 无 | 320B-A18B MoE,45 层,288 专家 |
| 上下文窗口 | 1,048,576 | 1,048,576(各 provider 262K–1.31M 不等) |
| 最大输出 | 131,072 | 主要端点 131,072 |
| 数据保留 | 由 provider 按 Stealth 条款保留,不用于训练 | 由各 provider 自己的政策约束 |
| 已发布跑分 | 无 | 完整第一方表格 + 独立评分 |
最重要的两行,恰好是大家会跳过的两行。
Provider 从 1 家变成 10 家——这不全是好消息。 在 Ox Alpha 时期,每个请求都打到同一个匿名端点,所以行为是统一的。今天 z-ai/glm-5.3-flash 会在十家 provider 之间路由,它们的上下文上限从 **262,144 token(Io Net)**到 1,310,720(Cloudflare),价格相差 2 倍。除非你锁定 provider,否则你在预览期观察到的一致性,在生产中没有保证。
数据政策变成了你的问题。 预览期间,OpenRouter 的 Stealth 模型条款为所有人设定了同一套政策:provider 保留 prompt 和 completion,且不用于训练。揭晓之后,你的数据如何被处理取决于十家里哪一家在服务你的请求。对任何有合规义务的人来说,这是一次真实的姿态变化,不是脚注。
迁移:具体要改什么
API 表面没变——同一个 OpenAI 兼容端点、同样的请求结构。有三处需要动。
1. 模型 ID。
- "model": "stealth/ox-alpha"
+ "model": "z-ai/glm-5.3-flash"
2. 加上 provider 锁定。 在只有一家 provider 时这根本不是个问题,现在是了:
{
"model": "z-ai/glm-5.3-flash",
"provider": { "order": ["Z.AI", "Novita"], "allow_fallbacks": false }
}
长上下文任务请设 allow_fallbacks: false。静默回落到一个 262K 上下文的 provider,会制造极难复现的截断报错,而这正是这个模型的 provider 分布会招来的失败模式。
3. 加上你此前不需要的成本控制。 Ox Alpha 是免费的,所以没人设过 max_tokens、限制过重试,或者考虑过 prompt 缓存。现在这三件事都要花钱——而且 GLM 5.3 Flash 的输入输出比是陡峭的 1:3.3,所以话多的输出正是账单膨胀的地方。它的缓存输入费率每 100 万 $0.03,比新鲜输入便宜五倍,这让 prompt 结构成为可用的最高杠杆优化。把稳定内容放最前面,并保证调用之间逐字节一致。
如果你想验证付费版是否还和你测过的那个一样,最快的路径是拿一个你已有预期的任务做并排对比——在 glm5.app 上跑一遍,和你在预览周保存下来的结果比一比。
付费版还一样好吗
诚实的答案:权重是同一份,没有证据表明质量变了。 变的是你现在可以验证它,而此前不能。
预览期间根本没有任何已发布跑分——模型页上没有分数,独立跟踪机构也没有收录。社区关于 Ox Alpha 质量的一切认知都来自轶事。揭晓之后你拿到了一份第一方表格,以及更有用的一份独立数据:
| 来源 | 指标 | 值 |
|---|---|---|
| Z.ai | Terminal-Bench 2.1 | 84.3(Claude Opus 4.8:85.0) |
| Z.ai | DeepSWE v1.1 | 63.4(GLM-5.2:46.2) |
| Z.ai | AutomationBench | 48.8(GLM-5.2:26.2) |
| Artificial Analysis | Intelligence Index | 57(同类中位数约 27) |
| Artificial Analysis | 输出速度 | 50.2 tok/s(同类中位数 67) |
| Artificial Analysis | 首 token 时间 | 1.47 s(同类中位数 2.14) |
那个 50.2 tok/s 是最该提醒迁移者的数字。在免费预览下,输出慢只是个小麻烦。在有延迟预算的生产环境里,它是一个设计约束——而且低于该模型体量级的中位数。这里的 "Flash" 指便宜,不指快。如果你预览期的测试比较随意,你可能没注意到。你的用户会注意到。
揭晓真正带来的改善
有三件事在揭晓时变好了,而且分量不轻。
MIT 开源权重。 预览期间,架构、参数量和 provider 全部未披露。今天权重挂在 Hugging Face 的 zai-org/GLM-5.3-Flash,采用 MIT 许可——商用、修改、再分发、私有分支全部允许,无营收门槛,无可接受使用条款附录。社区普遍预期的是闭源发布或者一个限制性的自定义许可;MIT 比几乎所有人的预测都更宽松。
一次真正的架构披露。 320B 总参数、18B 激活、45 层、每 token 从 288 个专家中路由 8 个,以及一套混合注意力栈——KDA 线性注意力层加 NoPE 稀疏 MLA 层——Z.ai 报告它相比 GLM-5.3 带来约 3 倍更少的注意力计算和 4.4 倍更小的 KV cache。最后那个数字正是百万 token 上下文可负担而非纸上谈兵的原因,而知道它,你就能推理这个模型而不是猜它。
厂商责任。 一个匿名 provider 可以不打招呼就变更或消失——而这恰恰就是发生过的事。一个有公开定价和 Coding Plan 的实名厂商,是你可以据以制定路线图的东西。
Z.ai 为什么要做潜行发布
值得理解,因为它解释了那批预览数据的用途。
潜行发布买到的是无偏评估。没人因为模型出自自己喜欢的实验室而给它的答案打高分,也没人因为相反的理由贬低它。六天里,这个模型只凭输出被评判——而且是在被评判的同时承接真实生产负载。OpenRouter 的活跃面板在预览期显示排名前五的消费方全是智能体编程工具,这是一次真实的压力测试,而不是演示。
Z.ai 的公告还补上了一个从探测端点绝对推不出来的细节:预览期间它完全跑在中国国产 AI 芯片上,围绕发布的报道称其使用了一套基于 SGLang 改造的服务引擎,带来约 3 倍的端到端服务性能提升。具体芯片厂商未披露。先在匿名生产负载下验证一套国产化服务栈、再揭晓身份,这是一个比一开始就宣布要有力得多的主张。
社区是怎么先破解的
揭晓对一部分人来说并不意外。在预览周里,r/LocalLLaMA 做了 tokenizer 指纹比对——约 60 条覆盖 emoji、韩文、全角拉丁、数学符号和西里尔字母的测试字符串——发现该端点的分词行为在其他家族出现分歧的地方与 GLM 家族匹配。端点泄漏出的一条 GLM-5.3 专属 API 报错佐证了这一点。
社区把实验室猜对了、模型猜错了:主流理论是 Ox Alpha 是 GLM-5.3 的隐藏多模态变体,而不是一个独立模型。结果它是 GLM-5.3-Flash——一个参数量不同、价格约为 GLM 5.3 十分之一的独立发布。这个推断之所以失败,理由值得记住:tokenizer 指纹识别的是家族,从来不是某一次具体的后训练。
揭晓后从业者的说法,在 GLM 5.3 Flash 在 Reddit 上有更多整理。把整件事当作它本来的样子看待——一次执行漂亮、但结论部分错误的社区调查。它是"去老帖子里找一线经验"的好理由,也是"不要在没有一手来源的情况下相信其中任何技术说法"的好理由。
现在该用哪个名字
到处都用 z-ai/glm-5.3-flash。 stealth/ox-alpha 这个 ID 属于一个已经结束的预览。文档、看板和评估笔记请现在就改名,别把一个死掉的代号继续带下去。
有一个例外:找一线反馈时,请搜 "Ox Alpha"。 六天的实际使用讨论——吞吐观察、智能体编程结果、各种脾气——都归档在代号下,用新名字搜不出来。这是关于这次改名最有用的一件事,也是这两个词还会共同出现好几个月的原因。
如果你在那个免费周里根本没测过、是现在才来的,上面的迁移与你无关——你只需要知道这两个名字是一个模型。打开一个 GLM 5.3 Flash 会话,按它现在的条款评估它,而这些条款的文档化程度远好于 Ox Alpha 当初交付的任何东西。
常见问题
Ox Alpha 和 GLM 5.3 Flash 是同一个吗?
是。Z.ai 的发布公告确认 GLM-5.3-Flash 此前以 Ox Alpha 名义预览。同一份权重,同一个模型。代号自 2026 年 8 月 20 日在 OpenRouter 上以 stealth/ox-alpha 运行,8 月 26 日揭晓。
Ox Alpha 还免费吗? 不免费了。免费预览在揭晓时结束。GLM 5.3 Flash 标价每 100 万输入 $0.15、输出 $0.50,目前 OpenRouter 上的 Z.AI、Novita 和 GMICloud 在执行限时 5 折($0.075/$0.25)。权重在 MIT 许可下免费,但自部署需要约 328 GB 显存。
stealth/ox-alpha 还能用吗?
它属于那个已经结束的预览。请迁移到 z-ai/glm-5.3-flash——请求格式其余部分不变。
揭晓之后模型变差了吗? 没有证据支持这一点;权重是同一份,而且现在公开发布,所以这个说法可以用预览期无法做到的方式去核实。变的是计费、provider 路由和数据政策——不是能力。
Z.ai 为什么要藏这个模型? 潜行发布能得到不受品牌偏见影响的评估,并在正式承诺前收集真实生产负载。Z.ai 还利用这个窗口验证了一套完全跑在中国国产 AI 芯片上的服务栈,而这一点是公告事后才披露的。
我还该搜 "Ox Alpha" 吗? 找一线反馈时该搜——六天的实操讨论都在那个名字下。查文档、价格和规格时,用 GLM 5.3 Flash。
来源
- GLM 5.3 Flash on OpenRouter——发布日期、Ox Alpha 沿革、模型 ID 与十家 provider 列表。
- OpenRouter endpoints API(z-ai/glm-5.3-flash)——各 provider 价格与上下文上限,2026 年 8 月 27 日查询。
- zai-org/GLM-5.3-Flash — Hugging Face——MIT 许可、320B-A18B 架构与第一方跑分表。
- Artificial Analysis — GLM-5.3-Flash——独立 Intelligence Index、输出速度与 TTFT。
- zai-org/GLM-5 — GitHub——官方混合注意力说明与推理配方。
核对于 2026 年 8 月 27 日。潜行周的社区调查细节仅作为社区信号呈现,不用于支撑技术主张;促销折扣会变动。




