Ox Alpha 上 OpenRouter:模型 ID、免费定价与 API 接入

Ox Alpha 上 OpenRouter:模型 ID、免费定价与 API 接入

Ox Alpha OpenRouter 免费接入指南:模型 ID stealth/ox-alpha、$0 预览定价、1M 上下文,附 curl 与 Python API 调用示例,快速上手智能体编程。

快速回答: Ox Alpha 已经上线 OpenRouter,模型 ID 为 stealth/ox-alpha——这是一个多模态推理模型(支持文本 + 图片 + 视频输入、文本输出),拥有 1,048,576 token(1M)的上下文窗口131,072 token 的最大输出,目前处于免费预览期,定价为 每 1M prompt token $0、每 1M completion token $0。你可以通过标准的 OpenAI 兼容端点 https://openrouter.ai/api/v1/chat/completions、携带 Bearer token 来调用它;由于推理(reasoning)是强制开启的,合理的默认设置是 reasoning_effort: "max"

如果你最近打开过 OpenRouter 的模型页面,大概也撞上了我撞过的同一堵墙:这个列表确实亮眼(免费、1M 上下文、131K 输出),但实操层面的信息很少——请求里到底要发什么、哪些参数会被采纳、以及提供商是匿名 "Stealth" 团队、没有任何已发布的 benchmark,这些到底意味着什么。这篇指南要补的正是这个缺口。

本文基于 OpenRouter 模型列表、公开的 OpenRouter models API 和官方公告数据编写,更新于 2026 年 8 月 22 日。我们按列表对模型的描述如实转述;我们自己没有对 Ox Alpha 跑过独立 benchmark。

模型卡片:stealth/ox-alpha 一览

字段
模型 IDstealth/ox-alpha
名称Ox Alpha
发布时间2026 年 8 月 20 日
上下文窗口1,048,576 token(1M)
最大输出131,072 token(max_completion_tokens
模态文本 + 图片 + 视频输入 → 文本输出
定价(预览期)$0 prompt / $0 completion
推理强制开启,默认 effort maxmax / high / low
默认采样temperature: 1top_p: 0.95

OpenRouter 自己的定位是:Ox Alpha 是"面向编程、长时智能体工作与生产负载设计的推理模型",适合"长周期软件工程、复杂推理,以及把文本与视觉上下文结合的工作流"。API 层面的用量信号也印证了这一点——发布后约两天内,该模型已消耗约 657B prompt token 和 7.95B completion token,最繁忙的五个应用全是智能体编程工具:Hermes Agent(约 120B token)、Claude Code(约 108B)、Oh-My-Pi(约 93.5B)、DeepSeek Harness(multimodal-bridge)(约 84.8B)和 ZCode(约 51.5B)。

用 curl 调用 Ox Alpha

OpenRouter 提供 OpenAI 兼容的 chat completions 端点,所以一条简单的 curl 就能跑通:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stealth/ox-alpha",
    "messages": [
      {"role": "user", "content": "Review this Rust codebase and propose a refactor plan for the error-handling layer."}
    ],
    "reasoning_effort": "max"
  }'

有三点值得注意:

  1. 模型 ID 是 stealth/ox-alpha——provider 命名空间是 stealth 而不是公司名,因为该提供商保持匿名。
  2. 推理无法关闭(API 报告 reasoning.mandatory: true),所以要显式选择 effort 级别,而不是留着隐式默认——max 是默认值,也是处理困难智能体任务的正确起点。
  3. 你只需要 $OPENROUTER_API_KEY——不需要任何按 provider 的凭据,因为 OpenRouter 已经替你对接了唯一的 "Stealth" 提供商。

用 Python 调用 Ox Alpha

openai SDK 指向 OpenRouter 的 base URL 也能用,但对教程来说,一条朴素的 requests 调用最直白:

import requests

resp = requests.post(
    "https://openrouter.ai/api/v1/chat/completions",
    headers={
        "Authorization": "Bearer $OPENROUTER_API_KEY",
        "Content-Type": "application/json",
    },
    json={
        "model": "stealth/ox-alpha",
        "messages": [
            {
                "role": "user",
                "content": "Trace this flaky test to its root cause and suggest a fix.",
            }
        ],
        "reasoning_effort": "max",
        "max_tokens": 131072,
    },
)
resp.raise_for_status()
print(resp.json()["choices"][0]["message"]["content"])

注意 max_tokens 上限:API 报告的最大输出上限为 131,072 tokenmax_completion_tokens),所以上面这个值就是真正的上限。实践中你很少需要这么多;把它设高只是消除长智能体输出被截断的风险。

在 Ox Alpha 上真正生效的参数

OpenRouter models API 为 stealth/ox-alpha 列出了以下受支持参数:

  • reasoning_effort —— max(默认)、highlow。没有 "off" 开关;推理是强制开启的。低成本查询用 low,多文件工程工作用 high/max
  • max_tokens —— 输出上限,最高到 131,072。
  • tools / tool_choice —— 完整的函数/工具调用支持,这正是让模型能在智能体循环里被使用的原因(Claude Code、Oh-My-Pi 以及其他头部消费方都是这么驱动它的)。
  • response_format —— 支持结构化/JSON 输出。
  • reasoning / include_reasoning —— 控制请求中推理如何处理,以及是否出现在响应里。
  • temperature —— 默认 1;想要更确定性的输出就调低。
  • top_p —— 默认 0.95top_k 也可用。

这是一套生产级的参数表面——尤其值得注意的是,这不是一个只能聊天的演示模型。强制推理、工具调用、结构化输出加 1M token 上下文的组合,瞄准的正是长时间运行的智能体工作负载。

计费与路由:"$0" 到底意味着什么

  • 价格: Ox Alpha 目前在 OpenRouter 上免费——每 1M prompt token $0、每 1M completion token $0。页面把这一项标为 "PRICE: Free",而且明确是预览期状态;预览期结束后的定价尚未公布
  • 路由: OpenRouter 只路由到名为 "Stealth" 的唯一提供商,直接转发、无路由决策——没有自动故障转移、没有最便宜提供商选择,没有任何可调的项。提供商是什么就是什么。
  • 影响: 如果 Stealth 宕机或降级,你的请求也会跟着宕机或降级。没有第二个上游可以回退。

数据政策:Stealth 会保留什么

模型页面上 Stealth 的声明值得完整读一遍,但关键条文是这几条:

"Ox Alpha 是一个 stealth 模型。它由一家选择在预览期间保持匿名的第三方提供商开发与运营。"

"OpenRouter 将请求路由给它,但并非其开发者、所有者或提供商。"

"Prompt 与 completion 由提供商保留,且不用于训练;除此之外的所有用途均受 Stealth Model Terms 约束。"

用大白话说:prompt 和 completion 会被提供商保留不会用于训练,其余一切受 Stealth Model Terms 约束。如果你的项目处理敏感数据,这条保留条款就是你需要戴上合规帽子的地方——要在把模型接进生产管道之前考虑清楚,而不是之后。

没人告诉你的那部分:把 stealth 模型投入生产前的检查清单

其他所有文章都停在"免费 + 1M 上下文"就完了。以下是我在把生产级智能体负载押在 stealth/ox-alpha 上之前会先跑一遍的清单——这绝不是 FUD,只是一个匿名、无 benchmark、预览期模型逼着你想清楚的东西:

  1. 免费窗口是合同还是促销? $0/$0 定价是预览期状态,预览期后的定价未公布。要按价格会变动来做预算——把你的成本核算设计成"未来按 token 计价只是一次配置变更",而不是架构变更。
  2. 单一提供商意味着没有故障转移。 OpenRouter 对唯一的 "Stealth" 提供商做直接转发,没有路由决策。如果 Stealth 的可用性下滑(OpenRouter 的 3 天监控显示可用性 99.14%、正常运行时间 99.99%),你的请求就会受影响——没有第二个上游。如果你的 SLA 承受不了这一点,就在路由层保留一个备用模型。
  3. 你能接受这份数据政策吗? prompt 和 completion 由提供商保留(按列表说明不用于训练)。对机密代码库来说,这条保留是一个实打实的考量——把 Stealth Model Terms 和你自己的数据处理要求逐条对照。
  4. 没有任何官方 benchmark。 模型页面的 Performance 区没有智能/编程/智能体分数,截至 2026 年 8 月 22 日,Artificial Analysis 也未收录该模型。社区报告的数字——比如在 10 任务 DeepSWE 子集上约 80% 的成绩、Kingbench 上声称的 87.5%——都是小样本、社区报告且未经独立验证;当传闻看,别当评测。在独立数字出现之前,请在你自己的工作负载上跑自己的评测。
  5. 身份未披露。 提供商身份、架构和参数量全部未披露。有未经证实的社区猜测(基于指纹/tokenizer/视频编码器对比)认为 Ox Alpha 可能是 GLM 系列模型的隐藏多模态变体——但这纯属猜测、未经证实,不足以作为架构决策的依据。

如果这五条你都核对过、答案都能接受,那么这个模型用起来确实舒服:交互速度足够快(OpenRouter 报告吞吐约 24 token/s、P50 延迟约 5.81s),预览期免费,而且生来就适合头部消费方正在做的那种长时智能体编程。如果你完全不想碰 API 的繁琐对接,也可以直接在浏览器里在 glm5.app 免费试用 Ox Alpha

常见问题(FAQ)

Ox Alpha 在 OpenRouter 上的模型 ID 是什么?

stealth/ox-alpha。provider 命名空间是 stealth,因为第三方提供商在预览期间保持匿名。

Ox Alpha 在 OpenRouter 上怎么收费?

免费预览期内每 1M prompt token $0、每 1M completion token $0。预览期后的定价尚未公布。

Ox Alpha 支持工具调用和结构化输出吗?

支持。toolstool_choiceresponse_format 都在模型的支持参数里,此外还有 reasoning_effortmax_tokenstemperaturetop_ptop_k

Ox Alpha 的上下文窗口和最大输出是多少?

1,048,576 token(1M)上下文,最大输出上限 131,072 token(max_completion_tokens)。

Ox Alpha 的提供商是谁?

是名为 "Stealth" 的单一提供商——一家选择在预览期间不表明身份的匿名第三方。OpenRouter 将请求路由给它,但并非其开发者、所有者或提供商。

Sources

最后更新:2026 年 8 月 22 日。 上述定价、可用性与数据政策细节以该日期官方页面显示为准;预览期条款(免费定价、匿名提供商、保留政策)可能变化,投入生产前请对照官方列表核实。最快的试驾方式是在浏览器里直接对话 Ox Alpha——不需要 API key,也不需要配置计费。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

Ox Alpha 上 OpenRouter:模型 ID、免费定价与 API 接入 - GLM 5