快速回答
Ox Alpha(stealth/ox-alpha)是 OpenRouter 上一个处于预览期的 reasoning 模型,目前列表定价为免费,拥有 1,048,576 token(1M)上下文窗口、最多 131,072 个输出 token,支持文本 + 图片 + 视频输入。一个务实的第一个任务应该长这样:挑一个范围收得住、不含敏感数据的编程或分析问题;把 reasoning effort 当成一个需要主动做的选择;喂进去一段组织良好的长上下文;只在工具调用和结构化输出确实值回那点延迟时才用它们;最后用一套可以反复重跑的小型评测给结果打分。你现在就可以在 glm5.app 上免费试用 Ox Alpha;这篇指南讲的是拿到访问权之后该做什么。
为什么「拿到访问权之后」才是难的那部分
关于 Ox Alpha 的报道基本都集中在访问方式上:预览期定价、API 参数、OpenCode Go 的限时活动。少有人讲的是 key 跑通之后发生的事:怎么选一个安全的第一个任务、reasoning effort 该给多大、长上下文要怎么准备,以及什么时候该动用工具调用、结构化输出或多模态输入。
这个缺口之所以重要,是因为 Ox Alpha 的官方列表有三个不太寻常的性质:reasoning 是强制的、提供方是匿名的、以及没有任何官方 benchmark 分数。这三点每一条都会改变你跑第一个真实负载的方式。下面所有事实均来自 OpenRouter 官方模型页面、公开的 OpenRouter API、OpenRouter 的 Stealth Model Terms 以及公开公告,核对日期为 2026 年 8 月 23 日。
选一个安全的第一个任务
OpenRouter 把 Ox Alpha 定位为面向编程、持续性 agentic 工作与生产负载的 reasoning 模型,也包括那些把文本与视觉上下文结合起来的工作流。这告诉你模型瞄准的是什么,但没告诉你第一个任务该选什么。
早期的用量信号指向同一个方向。公开的模型页面显示,用量集中在 agentic 编程工具上,包括 Hermes Agent、Claude Code、Oh-My-Pi、DeepSeek Harness 和 ZCode。所以别拿冷知识问答开场,从一个编程或多步推理任务开始。
第一个任务用三道筛子过一遍:
- 范围收得住: 一个仓库模块、一次重构、或者一份分析文档——不要是开放式的整个项目。
- 不含敏感数据: Stealth 条款明确写了提供方会留存 prompt 和 completion。先用合成数据、公开材料或已脱敏的内容。
- 结果可复核: 选一个有标准答案的任务,这样你才能判断结果到底对不对。
有意识地设定 reasoning effort
Ox Alpha 的 reasoning 是强制开启的,关不掉;默认 effort 是 max,API 支持 max、high、low 三档。这意味着 effort 的选择本身就是任务设计的一部分。
max留给任务里最硬的核心:多步演绎、长周期规划、或者跨整个仓库的推理。low用于机械性工作,比如信息抽取、格式整理、或者总结你本来就已经理解的材料。- 评测期间把档位固定住。 API 还暴露了
temperature、top_p和top_k;参数稳定,多次运行的结果才有可比性。
OpenRouter 的公开监控目前显示 P50 延迟约 5.81 秒、P50 吞吐约每秒 24 token。长请求配上 max 档,耗时到分钟级是正常的。把慢响应当成排期上的约束条件,别一看到慢就默认它失败了。
组织一段长上下文请求
Ox Alpha 支持 1,048,576 个输入 token 和最多 131,072 个输出 token。这是给真正大体量输入和长篇产出留的余量——不是让你把所有东西闭着眼睛粘进去的理由。
第一个任务,请求按这个顺序组织:
- 指令放最前: 角色、约束、期望格式、验收标准。
- 材料放中间: 先给仓库结构或文档索引,再给相关章节,不要重复堆料。
- 一个交付物放最后: 把要交付的结果写清楚,并且可以被验证。
一段组织良好的 50K token 上下文,通常比一段注水的 200K token 更有用。材料特别大的时候,先做一遍检索:把相关文件或章节挑出来,只把选中的内容喂进去。
什么时候该用工具调用和结构化输出
API 支持 tools、tool_choice、response_format、include_reasoning、max_tokens、reasoning_effort、temperature、top_k 和 top_p。工具调用和结构化输出都是可用的,但它们不该出现在每一个请求里。
当正确性取决于最新状态时才用工具:读文件、跑测试、查 API、校验 schema。当结果需要被下游脚本或 agent 解析时,才用 response_format。
不要把它们当默认配置加上去。每一次工具往返都会增加延迟,而一个不必要的 schema 只是多制造了一种失败模式。一条好用的第一任务法则很简单:答案完全包含在 prompt 里时,不用工具;任务必须观察变化中的状态时,用工具;结果要被另一个系统解析时,用结构化输出。
安全地使用图片与视频输入
这个模型接受文本、图片和视频输入,返回文本。截图、UI 稿、架构图和短视频片段都是很自然的多模态测试素材。
安全边界和文本是同一条,只是更容易被忘掉:图片和视频同样是 prompt。 一张 dashboard 截图里可能藏着客户数据、内部命名、token 或未公开的 UI。先从公开截图、合成 mockup,或者你有权分享的脱敏画面开始。
尊重匿名服务商的数据边界
Ox Alpha 是一个 stealth(隐身)模型。OpenRouter 明确说明:它由一家匿名的第三方服务商开发和运营;OpenRouter 只负责路由请求,不是它的开发者或所有者;prompt 和 completion 由服务商留存,但不用于训练。
放到第一个任务上,这意味着:
- 把这家服务商当作一个全新的供应商看待——身份、架构、参数量、预览结束后的价格,全都未披露。
- 不要发送密钥、凭证、客户数据或未发布的代码。
- OpenRouter 直接路由到一个名为 Stealth 的单一服务商,所以不存在路由歧义,也没有自动的多服务商冗余。
- 预览期的定价和条款都可能变化;别让一次初步实验演变成一个没人盯着的生产依赖。
大多数 Ox Alpha 教程漏掉的东西
多数教程讲的是怎么拿到访问权,或者把参数表复述一遍。真正开始用起来之后,下面这些运营层面的细节更重要。
- reasoning 是一个关不掉的旋钮。 强制开启加上默认
max,意味着 effort 选择属于 prompt 设计的一部分,而不是一个可有可无的 API 选项。 - 没有官方 benchmark。 模型列表上没有任何智能、编程或 agentic 分数。任何流传的数字都是社区自测、未经独立验证——所以你自己那套可重复的评测,才是唯一靠得住的信号。
- 用量数据暴露了真实负载。 公开用量信号里占主导的是 agentic 编程工具。一个长周期、带工具调用的任务,比一次性问答更有信息量。
- 数据边界是产品的一部分。 匿名的单一服务商 + 留存 prompt,是对你「能发什么」的硬约束,不是一行脚注。
- 免费只是一种预览状态。 $0/$0 的列表价会变,预览结束后的定价也未公开。趁价格还不是变量的时候,把基线测出来。
- 输出容量本身也是能力。 131,072 token 的输出上限,足以撑起详细方案、整文件草稿和多段式产出。只让它写一段话,根本没碰到它被设计来干的活。
跑一个可重复的小型评测
正因为没有官方分数,你自己的评测要做得小而固定:
- 挑 3–5 个有代表性的任务:一次重构、一个长上下文问题、一个视觉输入任务,以及在合适的场景下加一个工具调用任务。
- 把输入固定死:完全相同的 prompt、上下文、工具和 reasoning effort。
- 用一份简短的评分表:正确性、指令遵循、输出格式合规、工具使用是否合理。
- 记录输出并保留整套任务集,这样服务商那边一有变化,你可以原样重跑一遍。
趁预览期还免费的时候,把这条基线跑出来。如果你想找一个零配置的起点,可以在 glm5.app 上开一个免费的 Ox Alpha 对话,用同一个 stealth/ox-alpha 模型完成一个范围收得住的第一任务。
常见问题(FAQ)
Ox Alpha 真的免费吗?
OpenRouter 的列表目前显示预览期内 prompt 与 completion 均为 $0。预览结束后的定价没有公布。
可以把 reasoning 关掉吗?
不行。API 显示 reasoning 是强制开启的;可选的 effort 档位为 max、high 和 low。
上下文和输出窗口有多大?
公开 API 列出的是 1,048,576 token 上下文,最大输出 131,072 token。
支持图片和视频吗?
支持:文本、图片、视频输入,输出为文本。对视觉输入请套用同样的数据留存注意事项。
支持工具调用和 JSON 输出吗?
支持。已支持的参数包括 tools、tool_choice、response_format,以及 reasoning 和采样相关的控制项。
有官方 benchmark 分数吗?
没有。OpenRouter 的列表上没有任何 benchmark 分数。除非能被独立复现,否则把流传的社区分数当作未经验证的数据看待。
参考来源
- OpenRouter — Ox Alpha model page
- OpenRouter API — models
- OpenRouter — Stealth Model Terms
- OpenRouter documentation
- OpenCode docs — models
Ox Alpha 的预览期,是了解它脾气最便宜的一段时间。挑一个范围收得住的任务,把评测输入固定下来,跑一遍——之后任何时候想用同一个模型而又不想先搭一套框架,直接在 glm5.app 免费使用 Ox Alpha 就好。




