Ox Alpha 跑分解读:社区成绩到底能信几分

Ox Alpha 跑分解读:社区成绩到底能信几分

Ox Alpha 基准测试现状:官方无跑分,社区 DeepSWE 与 Kingbench 成绩未经独立验证——本文教你如何解读这些跑分数据,并亲自测试这个模型。

快速回答: Ox Alpha 目前没有任何官方跑分。OpenRouter 上 stealth/ox-alpha 的模型页没有列出任何智能、编程或 agentic 基准测试成绩,独立的第三方追踪平台 Artificial Analysis 也没有收录该模型(2026 年 8 月 22 日核查)。网上流传的数字——DeepSWE 10 任务子集约 80%、Kingbench 上 87.5%——均来自社区测试,样本量小,且未经独立验证。如果你正在评估 Ox Alpha,这篇文章会告诉你这些分数到底意味着什么,以及应该关注哪些更可靠的信号。

如果你一直在找 Ox Alpha 的跑分,大概会撞上同一堵墙:2026 年 8 月 20 日上线了一个新模型,X 上和 OpenCode 公告里都在讨论它,可你真要去找硬数据时,官方页面一片沉默,社区帖子连测试方法都对不上。对 stealth 模型(预览期供应商保持匿名的模型)来说,这种沉默很容易被误读为实力不济,也很容易被一张排行榜截图盖过去。本指南基于 OpenRouter 的模型列表、公开 API 数据和公开公告编写,更新于 2026 年 8 月 22 日。我们没有自己跑过正式基准测试;本文的目标是给你一套解读外部跑分说法的框架,加上确实存在的官方数据。

官方记分牌空空如也——这是有意为之

Ox Alpha 于 2026 年 8 月 20 日登陆 OpenRouter。官方列表在集成相关的细节上写得很清楚:1,048,576 token(1M)的 context window(上下文窗口)、最高 131,072 token 的输出、文本/图像/视频输入加文本输出、预览期两侧均为每百万 token $0、reasoning(推理)为强制开启且默认最高强度,并支持工具、工具选择(tool choice)和结构化输出。定位说明也很直白:这是一款「专为编程、持续性 agentic 工作和生产负载设计的 reasoning 模型」,适合「长周期软件工程、复杂推理,以及文本与视觉上下文结合的流程」。

而列表里没有的,正是基准测试成绩。Performance 部分没有智能指数、没有编程排行榜数字、没有 agentic 分数。大家通常第一个去查的独立追踪平台 Artificial Analysis 也没有收录该模型(2026 年 8 月 22 日核查)。至于解读分数通常需要的细节——供应商身份、架构、参数量、预览期后的定价——在本次预览期间均未披露。

这一点值得明说:官方跑分缺失是列表本身的事实,而不是能力的证据。 Stealth 模型常常跳过跑分,部分原因就是不想在正式发布前被数字钉死。正确的问题不是「为什么没有跑分?」,而是「有什么信号是值得信任的?」——这正是本文后面要回答的。

社区在传什么

目前流传的有两个数字:

1. DeepSWE 10 任务子集约 80%。 一项社区测试报告 Ox Alpha 在 DeepSWE 的 10 任务子集上拿到约 80%(社区测试,未经独立验证)。同一小样本对比中,Fable 为 65%,GPT-5.6 Sol 为 52%。注意测试方法:这只是基准的一个子集——十道任务,不是完整测试集——所以 80% 和 65% 之间的差距,往多往少说都只是几道任务的事。

2. Kingbench 上 87.5%。 一篇社区文章报告 Ox Alpha 在 Kingbench 上拿到 87.5%,排在 91.25% 的 GLM-5.3 之后位列第二(社区测试,未经独立验证)。Kingbench 并不是标准基准:它没有公开、可审计的测试方法,也没有独立实验室在跑它。最多只能把这个数字当方向性参考。

此外还有基于指纹、tokenizer 和视频编码器比对而产生的猜测,认为 Ox Alpha 可能是 GLM 系列某个模型的隐藏多模态变体(未经证实,纯属推测)。我们不认同这个猜测,它也不该影响你的决策——但它解释了为什么有些帖子把该模型当成「预期擅长编程」,而不是「已被证明擅长编程」。

如何解读社区跑分:一个实用框架

大多数文章只是把数字复述一遍。这里说说他们通常漏掉的部分——在任何社区分数赢得你的信任之前,先问四个问题。

问题 1:样本量有多大? 一项 10 任务的测试,每道任务就值约 10 个百分点。一次运气好或差的运行,就能左右整个标题数字。经验法则:任何基于少于 50 个任务样本的分数,只当信号,不当结论。它告诉你这个模型值得一试,但并不能告诉你它排第几。

问题 2:这个基准到底测的是什么? DeepSWE 是一个长周期软件工程基准——模型必须在真实仓库里经过多轮交互才能解决一个问题,这很接近 agentic 生产工作。Kingbench 的测试方法不明(非标准),你甚至说不清它测的是什么。一轮问答的分数对一个 agentic 编程模型几乎说明不了什么,反过来也一样。在给数字加权之前,先看基准的工作负载和你的工作负载是否匹配。

问题 3:谁跑的,有没有独立验证? 社区测试不是同行评审。如果跑测试的人和结果有利益关系——供应商、联盟推广、炒作账号——就要打折扣。检验测试的标准是能否复现:你能看到确切的题目集合、测试框架和模型配置吗?看不到的话,那个数字只是一个说法,不是一次测量。

问题 4:对比是否公平对等? 每个模型用的是不是同一个任务子集?同样的 temperature、同样的工具、同样的尝试次数?DeepSWE 80% 的对比看起来内部一致,但它仍然是一方自选的子集。只要表里任何一个模型是在不同条件下跑的,整张表就作废。

一句话总结:社区跑分的用途只有一个——帮你列一份候选清单。它们不适合用来给模型排名,对任何人都没法审计的 stealth 模型来说尤其不可靠。

更可靠的信号:真实使用数据说了什么

以下是大多数找跑分的帖子都会跳过的官方数据部分。OpenRouter 的 Apps/Activity 视图展示的是真实的生产流量:上线后大约两天里,Ox Alpha 消耗了约 6570 亿 prompt token 和 79.5 亿 completion token。贡献流量最大的五个应用全是 agentic 编程工具:Hermes Agent(1200 亿 token)、Claude Code(1080 亿)、Oh-My-Pi(935 亿)、带多模态桥接的 DeepSeek Harness(848 亿)和 ZCode(515 亿)。

为什么这比一张未经验证的 10 任务截图更有说服力?因为它是数千名用户在持续跑真实长周期负载的聚合结果。Agentic 工具就是最严苛的压力测试:它们要跨多轮对话保持上下文、调用工具、从错误中恢复、一直干下去。如果团队在两天内把 6570 亿 prompt token 灌给一个模型,这证明它在现实负载下确实有用——虽然不是排行榜地位的证据,但比 10 任务的说法有力得多。

运营层面,官方监控(约三天的 P50)报告吞吐为每秒 24 token、延迟 5.81 秒、正常运行时间 99.99%、可用性 99.14%。生态采用也印证了这一趋势:Ox Alpha(「Ox Alpha Free」)已列入 OpenCode Go,未来一周有有限免费窗口,接近无限的使用量且不计入 Go 套餐用量,零数据留存,同样是 1M context。这是工具厂商的公开承诺,不是传闻。

如果你的工作正好是长周期编程和 agentic 任务——正是使用数据所显示的画像——现在就可以在 glm5.app 免费体验 Ox Alpha

如何亲自跑 Ox Alpha 基准测试

鉴于公开数据的现状,对你的使用场景来说最可靠的基准,就是你自己跑的那个。具体来说:

  1. 从你的真实工作中挑 3–5 个任务。 在熟悉的仓库里做一次重构、一次多步调试、一次带工具调用的长 agentic 运行,或者一个把截图/文档和指令混合在一起的任务——该模型支持图像和视频输入。
  2. 用同一个 prompt 分别跑 Ox Alpha 和你当前的模型。 同样的指令、同样的工具、同样的 temperature。两次运行之间不要改动任何设置。
  3. 按完成度和质量打分,别凭感觉。 任务完成了吗?第一次尝试输出就是对的吗?需要多少人工干预?
  4. 往长周期方向压。 有 1M token 的 context window 和默认最高强度的 reasoning,Ox Alpha 就是为持续工作设计的。单轮问答看不出它的能力;一轮 20 次的 agentic 运行才行。
  5. 公平调参。 API 支持 reasoning 强度(max/high/low)、工具和工具选择、结构化输出、temperature 以及 top_p/top_k——所以你能在完全相同、可复现的条件下做对比。

几个提醒,帮你校准预期:本次预览期间供应商保持匿名,OpenRouter 的免费价格窗口和 OpenCode 的免费一周随时可能变化,本文内容也不能替代官方页面。你测试的是模型今天的实际状态——这才是评估 stealth 发布最诚实的方式。

如果你不想一开始就接 API key,可以直接在 glm5.app 上在浏览器里和 Ox Alpha 对话——免费网页入口——五分钟内就能跑起你的第一个任务。

FAQ

Ox Alpha 有官方跑分吗? 没有。OpenRouter 的列表包含规格、定价和性能监控,但没有智能、编程或 agentic 基准成绩。Artificial Analysis 也没有收录该模型(2026 年 8 月 22 日核查)。

Ox Alpha 在 DeepSWE 和 Kingbench 上表现如何? 据社区测试:DeepSWE 10 任务子集约 80%(同一次小样本测试中 Fable 为 65%、GPT-5.6 Sol 为 52%),Kingbench 上 87.5%,落后于 91.25% 的 GLM-5.3。两项结果均为社区测试,未经独立验证;Kingbench 是非标准基准。

社区分数能信吗? 当信号可以,当结论不行。它们来自微小样本,没有任何独立验证。给任何数字加权之前,先过一遍上面的四问框架——样本量、测的是什么、谁跑的、方法是否对等。

Ox Alpha 快吗? OpenRouter 的监控(P50,约三天)报告吞吐为每秒 24 token、延迟 5.81 秒,正常运行时间 99.99%、可用性 99.14%。注意 reasoning 是强制开启且默认最高强度,所以复杂任务上要做好思考时间的预期。

我自己怎么给 Ox Alpha 跑分? 拿你自己的真实任务和你当前的模型做同条件对比——同样的 prompt、同样的工具、同样的设置。最快的入门方式是 glm5.app 上的免费网页聊天;通过 OpenRouter 的 API(预览期免费)则可以用工具和结构化输出做程序化测试。

Sources

最后更新:2026 年 8 月 22 日

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

Ox Alpha 跑分解读:社区成绩到底能信几分 - GLM 5