快速回答: Ox Alpha 已经上线 OpenRouter,模型 ID 为 stealth/ox-alpha——这是一个多模态推理模型(支持文本 + 图片 + 视频输入、文本输出),拥有 1,048,576 token(1M)的上下文窗口和 131,072 token 的最大输出,目前处于免费预览期,定价为 每 1M prompt token $0、每 1M completion token $0。你可以通过标准的 OpenAI 兼容端点 https://openrouter.ai/api/v1/chat/completions、携带 Bearer token 来调用它;由于推理(reasoning)是强制开启的,合理的默认设置是 reasoning_effort: "max"。
如果你最近打开过 OpenRouter 的模型页面,大概也撞上了我撞过的同一堵墙:这个列表确实亮眼(免费、1M 上下文、131K 输出),但实操层面的信息很少——请求里到底要发什么、哪些参数会被采纳、以及提供商是匿名 "Stealth" 团队、没有任何已发布的 benchmark,这些到底意味着什么。这篇指南要补的正是这个缺口。
本文基于 OpenRouter 模型列表、公开的 OpenRouter models API 和官方公告数据编写,更新于 2026 年 8 月 22 日。我们按列表对模型的描述如实转述;我们自己没有对 Ox Alpha 跑过独立 benchmark。
模型卡片:stealth/ox-alpha 一览
| 字段 | 值 |
|---|---|
| 模型 ID | stealth/ox-alpha |
| 名称 | Ox Alpha |
| 发布时间 | 2026 年 8 月 20 日 |
| 上下文窗口 | 1,048,576 token(1M) |
| 最大输出 | 131,072 token(max_completion_tokens) |
| 模态 | 文本 + 图片 + 视频输入 → 文本输出 |
| 定价(预览期) | $0 prompt / $0 completion |
| 推理 | 强制开启,默认 effort max(max / high / low) |
| 默认采样 | temperature: 1,top_p: 0.95 |
OpenRouter 自己的定位是:Ox Alpha 是"面向编程、长时智能体工作与生产负载设计的推理模型",适合"长周期软件工程、复杂推理,以及把文本与视觉上下文结合的工作流"。API 层面的用量信号也印证了这一点——发布后约两天内,该模型已消耗约 657B prompt token 和 7.95B completion token,最繁忙的五个应用全是智能体编程工具:Hermes Agent(约 120B token)、Claude Code(约 108B)、Oh-My-Pi(约 93.5B)、DeepSeek Harness(multimodal-bridge)(约 84.8B)和 ZCode(约 51.5B)。
用 curl 调用 Ox Alpha
OpenRouter 提供 OpenAI 兼容的 chat completions 端点,所以一条简单的 curl 就能跑通:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/ox-alpha",
"messages": [
{"role": "user", "content": "Review this Rust codebase and propose a refactor plan for the error-handling layer."}
],
"reasoning_effort": "max"
}'
有三点值得注意:
- 模型 ID 是
stealth/ox-alpha——provider 命名空间是stealth而不是公司名,因为该提供商保持匿名。 - 推理无法关闭(API 报告
reasoning.mandatory: true),所以要显式选择 effort 级别,而不是留着隐式默认——max是默认值,也是处理困难智能体任务的正确起点。 - 你只需要
$OPENROUTER_API_KEY——不需要任何按 provider 的凭据,因为 OpenRouter 已经替你对接了唯一的 "Stealth" 提供商。
用 Python 调用 Ox Alpha
把 openai SDK 指向 OpenRouter 的 base URL 也能用,但对教程来说,一条朴素的 requests 调用最直白:
import requests
resp = requests.post(
"https://openrouter.ai/api/v1/chat/completions",
headers={
"Authorization": "Bearer $OPENROUTER_API_KEY",
"Content-Type": "application/json",
},
json={
"model": "stealth/ox-alpha",
"messages": [
{
"role": "user",
"content": "Trace this flaky test to its root cause and suggest a fix.",
}
],
"reasoning_effort": "max",
"max_tokens": 131072,
},
)
resp.raise_for_status()
print(resp.json()["choices"][0]["message"]["content"])
注意 max_tokens 上限:API 报告的最大输出上限为 131,072 token(max_completion_tokens),所以上面这个值就是真正的上限。实践中你很少需要这么多;把它设高只是消除长智能体输出被截断的风险。
在 Ox Alpha 上真正生效的参数
OpenRouter models API 为 stealth/ox-alpha 列出了以下受支持参数:
reasoning_effort——max(默认)、high或low。没有 "off" 开关;推理是强制开启的。低成本查询用low,多文件工程工作用high/max。max_tokens—— 输出上限,最高到 131,072。tools/tool_choice—— 完整的函数/工具调用支持,这正是让模型能在智能体循环里被使用的原因(Claude Code、Oh-My-Pi 以及其他头部消费方都是这么驱动它的)。response_format—— 支持结构化/JSON 输出。reasoning/include_reasoning—— 控制请求中推理如何处理,以及是否出现在响应里。temperature—— 默认 1;想要更确定性的输出就调低。top_p—— 默认 0.95;top_k也可用。
这是一套生产级的参数表面——尤其值得注意的是,这不是一个只能聊天的演示模型。强制推理、工具调用、结构化输出加 1M token 上下文的组合,瞄准的正是长时间运行的智能体工作负载。
计费与路由:"$0" 到底意味着什么
- 价格: Ox Alpha 目前在 OpenRouter 上免费——每 1M prompt token $0、每 1M completion token $0。页面把这一项标为 "PRICE: Free",而且明确是预览期状态;预览期结束后的定价尚未公布。
- 路由: OpenRouter 只路由到名为 "Stealth" 的唯一提供商,直接转发、无路由决策——没有自动故障转移、没有最便宜提供商选择,没有任何可调的项。提供商是什么就是什么。
- 影响: 如果 Stealth 宕机或降级,你的请求也会跟着宕机或降级。没有第二个上游可以回退。
数据政策:Stealth 会保留什么
模型页面上 Stealth 的声明值得完整读一遍,但关键条文是这几条:
"Ox Alpha 是一个 stealth 模型。它由一家选择在预览期间保持匿名的第三方提供商开发与运营。"
"OpenRouter 将请求路由给它,但并非其开发者、所有者或提供商。"
"Prompt 与 completion 由提供商保留,且不用于训练;除此之外的所有用途均受 Stealth Model Terms 约束。"
用大白话说:prompt 和 completion 会被提供商保留,不会用于训练,其余一切受 Stealth Model Terms 约束。如果你的项目处理敏感数据,这条保留条款就是你需要戴上合规帽子的地方——要在把模型接进生产管道之前考虑清楚,而不是之后。
没人告诉你的那部分:把 stealth 模型投入生产前的检查清单
其他所有文章都停在"免费 + 1M 上下文"就完了。以下是我在把生产级智能体负载押在 stealth/ox-alpha 上之前会先跑一遍的清单——这绝不是 FUD,只是一个匿名、无 benchmark、预览期模型逼着你想清楚的东西:
- 免费窗口是合同还是促销? $0/$0 定价是预览期状态,预览期后的定价未公布。要按价格会变动来做预算——把你的成本核算设计成"未来按 token 计价只是一次配置变更",而不是架构变更。
- 单一提供商意味着没有故障转移。 OpenRouter 对唯一的 "Stealth" 提供商做直接转发,没有路由决策。如果 Stealth 的可用性下滑(OpenRouter 的 3 天监控显示可用性 99.14%、正常运行时间 99.99%),你的请求就会受影响——没有第二个上游。如果你的 SLA 承受不了这一点,就在路由层保留一个备用模型。
- 你能接受这份数据政策吗? prompt 和 completion 由提供商保留(按列表说明不用于训练)。对机密代码库来说,这条保留是一个实打实的考量——把 Stealth Model Terms 和你自己的数据处理要求逐条对照。
- 没有任何官方 benchmark。 模型页面的 Performance 区没有智能/编程/智能体分数,截至 2026 年 8 月 22 日,Artificial Analysis 也未收录该模型。社区报告的数字——比如在 10 任务 DeepSWE 子集上约 80% 的成绩、Kingbench 上声称的 87.5%——都是小样本、社区报告且未经独立验证;当传闻看,别当评测。在独立数字出现之前,请在你自己的工作负载上跑自己的评测。
- 身份未披露。 提供商身份、架构和参数量全部未披露。有未经证实的社区猜测(基于指纹/tokenizer/视频编码器对比)认为 Ox Alpha 可能是 GLM 系列模型的隐藏多模态变体——但这纯属猜测、未经证实,不足以作为架构决策的依据。
如果这五条你都核对过、答案都能接受,那么这个模型用起来确实舒服:交互速度足够快(OpenRouter 报告吞吐约 24 token/s、P50 延迟约 5.81s),预览期免费,而且生来就适合头部消费方正在做的那种长时智能体编程。如果你完全不想碰 API 的繁琐对接,也可以直接在浏览器里在 glm5.app 免费试用 Ox Alpha。
常见问题(FAQ)
Ox Alpha 在 OpenRouter 上的模型 ID 是什么?
stealth/ox-alpha。provider 命名空间是 stealth,因为第三方提供商在预览期间保持匿名。
Ox Alpha 在 OpenRouter 上怎么收费?
免费预览期内每 1M prompt token $0、每 1M completion token $0。预览期后的定价尚未公布。
Ox Alpha 支持工具调用和结构化输出吗?
支持。tools、tool_choice 和 response_format 都在模型的支持参数里,此外还有 reasoning_effort、max_tokens、temperature、top_p 和 top_k。
Ox Alpha 的上下文窗口和最大输出是多少?
1,048,576 token(1M)上下文,最大输出上限 131,072 token(max_completion_tokens)。
Ox Alpha 的提供商是谁?
是名为 "Stealth" 的单一提供商——一家选择在预览期间不表明身份的匿名第三方。OpenRouter 将请求路由给它,但并非其开发者、所有者或提供商。
Sources
最后更新:2026 年 8 月 22 日。 上述定价、可用性与数据政策细节以该日期官方页面显示为准;预览期条款(免费定价、匿名提供商、保留政策)可能变化,投入生产前请对照官方列表核实。最快的试驾方式是在浏览器里直接对话 Ox Alpha——不需要 API key,也不需要配置计费。




