如何使用 Ox Alpha:第一个任务的实战工作流
Aug 23, 2026

如何使用 Ox Alpha:第一个任务的实战工作流

Ox Alpha 怎么用:从选一个安全的第一个任务开始,讲清 reasoning effort 档位、1M 上下文的组织方式、工具调用与结构化输出的取舍,以及一套可重复的小型评测方法。

快速回答

Ox Alpha(stealth/ox-alpha)是 OpenRouter 上一个处于预览期的 reasoning 模型,目前列表定价为免费,拥有 1,048,576 token(1M)上下文窗口、最多 131,072 个输出 token,支持文本 + 图片 + 视频输入。一个务实的第一个任务应该长这样:挑一个范围收得住、不含敏感数据的编程或分析问题;把 reasoning effort 当成一个需要主动做的选择;喂进去一段组织良好的长上下文;只在工具调用和结构化输出确实值回那点延迟时才用它们;最后用一套可以反复重跑的小型评测给结果打分。你现在就可以在 glm5.app 上免费试用 Ox Alpha;这篇指南讲的是拿到访问权之后该做什么。

为什么「拿到访问权之后」才是难的那部分

关于 Ox Alpha 的报道基本都集中在访问方式上:预览期定价、API 参数、OpenCode Go 的限时活动。少有人讲的是 key 跑通之后发生的事:怎么选一个安全的第一个任务、reasoning effort 该给多大、长上下文要怎么准备,以及什么时候该动用工具调用、结构化输出或多模态输入。

这个缺口之所以重要,是因为 Ox Alpha 的官方列表有三个不太寻常的性质:reasoning 是强制的、提供方是匿名的、以及没有任何官方 benchmark 分数。这三点每一条都会改变你跑第一个真实负载的方式。下面所有事实均来自 OpenRouter 官方模型页面、公开的 OpenRouter API、OpenRouter 的 Stealth Model Terms 以及公开公告,核对日期为 2026 年 8 月 23 日。

选一个安全的第一个任务

OpenRouter 把 Ox Alpha 定位为面向编程、持续性 agentic 工作与生产负载的 reasoning 模型,也包括那些把文本与视觉上下文结合起来的工作流。这告诉你模型瞄准的是什么,但没告诉你第一个任务该选什么。

早期的用量信号指向同一个方向。公开的模型页面显示,用量集中在 agentic 编程工具上,包括 Hermes Agent、Claude Code、Oh-My-Pi、DeepSeek Harness 和 ZCode。所以别拿冷知识问答开场,从一个编程或多步推理任务开始。

第一个任务用三道筛子过一遍:

  • 范围收得住: 一个仓库模块、一次重构、或者一份分析文档——不要是开放式的整个项目。
  • 不含敏感数据: Stealth 条款明确写了提供方会留存 prompt 和 completion。先用合成数据、公开材料或已脱敏的内容。
  • 结果可复核: 选一个有标准答案的任务,这样你才能判断结果到底对不对。

有意识地设定 reasoning effort

Ox Alpha 的 reasoning 是强制开启的,关不掉;默认 effort 是 max,API 支持 maxhighlow 三档。这意味着 effort 的选择本身就是任务设计的一部分。

  • max 留给任务里最硬的核心:多步演绎、长周期规划、或者跨整个仓库的推理。
  • low 用于机械性工作,比如信息抽取、格式整理、或者总结你本来就已经理解的材料。
  • 评测期间把档位固定住。 API 还暴露了 temperaturetop_ptop_k;参数稳定,多次运行的结果才有可比性。

OpenRouter 的公开监控目前显示 P50 延迟约 5.81 秒、P50 吞吐约每秒 24 token。长请求配上 max 档,耗时到分钟级是正常的。把慢响应当成排期上的约束条件,别一看到慢就默认它失败了。

组织一段长上下文请求

Ox Alpha 支持 1,048,576 个输入 token 和最多 131,072 个输出 token。这是给真正大体量输入和长篇产出留的余量——不是让你把所有东西闭着眼睛粘进去的理由。

第一个任务,请求按这个顺序组织:

  1. 指令放最前: 角色、约束、期望格式、验收标准。
  2. 材料放中间: 先给仓库结构或文档索引,再给相关章节,不要重复堆料。
  3. 一个交付物放最后: 把要交付的结果写清楚,并且可以被验证。

一段组织良好的 50K token 上下文,通常比一段注水的 200K token 更有用。材料特别大的时候,先做一遍检索:把相关文件或章节挑出来,只把选中的内容喂进去。

什么时候该用工具调用和结构化输出

API 支持 toolstool_choiceresponse_formatinclude_reasoningmax_tokensreasoning_efforttemperaturetop_ktop_p。工具调用和结构化输出都是可用的,但它们不该出现在每一个请求里。

当正确性取决于最新状态时才用工具:读文件、跑测试、查 API、校验 schema。当结果需要被下游脚本或 agent 解析时,才用 response_format

不要把它们当默认配置加上去。每一次工具往返都会增加延迟,而一个不必要的 schema 只是多制造了一种失败模式。一条好用的第一任务法则很简单:答案完全包含在 prompt 里时,不用工具;任务必须观察变化中的状态时,用工具;结果要被另一个系统解析时,用结构化输出。

安全地使用图片与视频输入

这个模型接受文本、图片和视频输入,返回文本。截图、UI 稿、架构图和短视频片段都是很自然的多模态测试素材。

安全边界和文本是同一条,只是更容易被忘掉:图片和视频同样是 prompt。 一张 dashboard 截图里可能藏着客户数据、内部命名、token 或未公开的 UI。先从公开截图、合成 mockup,或者你有权分享的脱敏画面开始。

尊重匿名服务商的数据边界

Ox Alpha 是一个 stealth(隐身)模型。OpenRouter 明确说明:它由一家匿名的第三方服务商开发和运营;OpenRouter 只负责路由请求,不是它的开发者或所有者;prompt 和 completion 由服务商留存,但不用于训练。

放到第一个任务上,这意味着:

  • 把这家服务商当作一个全新的供应商看待——身份、架构、参数量、预览结束后的价格,全都未披露。
  • 不要发送密钥、凭证、客户数据或未发布的代码。
  • OpenRouter 直接路由到一个名为 Stealth 的单一服务商,所以不存在路由歧义,也没有自动的多服务商冗余。
  • 预览期的定价和条款都可能变化;别让一次初步实验演变成一个没人盯着的生产依赖。

大多数 Ox Alpha 教程漏掉的东西

多数教程讲的是怎么拿到访问权,或者把参数表复述一遍。真正开始用起来之后,下面这些运营层面的细节更重要。

  1. reasoning 是一个关不掉的旋钮。 强制开启加上默认 max,意味着 effort 选择属于 prompt 设计的一部分,而不是一个可有可无的 API 选项。
  2. 没有官方 benchmark。 模型列表上没有任何智能、编程或 agentic 分数。任何流传的数字都是社区自测、未经独立验证——所以你自己那套可重复的评测,才是唯一靠得住的信号。
  3. 用量数据暴露了真实负载。 公开用量信号里占主导的是 agentic 编程工具。一个长周期、带工具调用的任务,比一次性问答更有信息量。
  4. 数据边界是产品的一部分。 匿名的单一服务商 + 留存 prompt,是对你「能发什么」的硬约束,不是一行脚注。
  5. 免费只是一种预览状态。 $0/$0 的列表价会变,预览结束后的定价也未公开。趁价格还不是变量的时候,把基线测出来。
  6. 输出容量本身也是能力。 131,072 token 的输出上限,足以撑起详细方案、整文件草稿和多段式产出。只让它写一段话,根本没碰到它被设计来干的活。

跑一个可重复的小型评测

正因为没有官方分数,你自己的评测要做得小而固定:

  • 挑 3–5 个有代表性的任务:一次重构、一个长上下文问题、一个视觉输入任务,以及在合适的场景下加一个工具调用任务。
  • 把输入固定死:完全相同的 prompt、上下文、工具和 reasoning effort。
  • 用一份简短的评分表:正确性、指令遵循、输出格式合规、工具使用是否合理。
  • 记录输出并保留整套任务集,这样服务商那边一有变化,你可以原样重跑一遍。

趁预览期还免费的时候,把这条基线跑出来。如果你想找一个零配置的起点,可以在 glm5.app 上开一个免费的 Ox Alpha 对话,用同一个 stealth/ox-alpha 模型完成一个范围收得住的第一任务。

常见问题(FAQ)

Ox Alpha 真的免费吗?

OpenRouter 的列表目前显示预览期内 prompt 与 completion 均为 $0。预览结束后的定价没有公布。

可以把 reasoning 关掉吗?

不行。API 显示 reasoning 是强制开启的;可选的 effort 档位为 maxhighlow

上下文和输出窗口有多大?

公开 API 列出的是 1,048,576 token 上下文,最大输出 131,072 token。

支持图片和视频吗?

支持:文本、图片、视频输入,输出为文本。对视觉输入请套用同样的数据留存注意事项。

支持工具调用和 JSON 输出吗?

支持。已支持的参数包括 toolstool_choiceresponse_format,以及 reasoning 和采样相关的控制项。

有官方 benchmark 分数吗?

没有。OpenRouter 的列表上没有任何 benchmark 分数。除非能被独立复现,否则把流传的社区分数当作未经验证的数据看待。

参考来源

Ox Alpha 的预览期,是了解它脾气最便宜的一段时间。挑一个范围收得住的任务,把评测输入固定下来,跑一遍——之后任何时候想用同一个模型而又不想先搭一套框架,直接在 glm5.app 免费使用 Ox Alpha 就好。

立即开始使用 GLM 5

免费试用 GLM 5 — 推理、编程、智能体和图像生成,一个平台全搞定。

如何使用 Ox Alpha:第一个任务的实战工作流 - GLM 5