定価
$0.15
入力 100 万トークンあたり
GLM 5.3 Flash のコスト試算は割引価格ではなくこちらを基準に。
GLM 5 ファミリーにおける Z.ai の効率重視モデル。総パラメータ 320B・アクティブ 18B の Mixture-of-Experts で、テキスト・画像・動画入力、100 万トークン文脈、MIT のオープン重みを備えます。
GLM 5.3 Flash は 2026 年 8 月 26 日に公開されました。その前の 6 日間は、OpenRouter でステルスモデル Ox Alpha として動いていました。
1 トークンあたり発火するのは 288 個中 8 個のエキスパートだけ。メモリは 320B、計算量は 18B 相当です。
視覚能力は 30T トークンの事前学習コーパス由来で、後付けのエンコーダーではありません。
Artificial Analysis の計測では出力 50.2 トークン/秒で、同クラス中央値の 67 t/s を下回ります。
アーキテクチャ、重み、ライセンスは Hugging Face のモデルカードと zai-org/GLM-5 リポジトリに基づきます。
モデルカード
MoE、45 層、288 個中 8 個のエキスパート。
18B の密モデルと同等の計算量。
Io Net は 262,144、Cloudflare は 1,310,720 が上限。
最大 1,179,648 と記載する提供元もあります。
入力はマルチモーダル、出力はテキスト。
重みとライセンス
商用利用も再配布も可、しきい値なし。
-BF16 版と ModelScope ミラーもあります。
単独リポジトリはなし。GLM-5 は Apache-2.0。
ワークステーションではなくマルチノード構成が前提。
TokenSpeed、KTransformers、コミュニティ製 GGUF も対応。
モデルカードおよび OpenRouter の endpoints API、2026 年 8 月時点。
料金 / 04
Z.ai の定価は 100 万トークンあたり入力 $0.15、出力 $0.50 です。各所で引用される $0.075 / $0.25 は期間限定 50% オフのローンチ割引です。
定価
$0.15
GLM 5.3 Flash のコスト試算は割引価格ではなくこちらを基準に。
定価
$0.50
1:3.3 という急な比率。まず出力量に上限を設けましょう。
定価
$0.03
新規入力の 5 分の 1。長い文脈を現実的なコストにする要因です。
第三者計測
$0.10
Artificial Analysis による、キャッシュ・入力・出力 7:2:1 の想定。
ベンチマーク / 05
Z.ai は自社の表を公開し、比較対象も自ら選んでいます。GLM 5.2 との差分と Artificial Analysis の数値は検証に耐えます。
Z.ai 公表
GPT-5.6 Terra は 87.4。難易度が上がるほど差は開きます。
Z.ai 公表
同じ系列・同じ手法で価格は 10 分の 1。AutomationBench は 48.8 対 26.2。
Z.ai 公表
文書と視覚の推論。Opus 4.8 を上回るとされています。
Artificial Analysis
57
第三者計測。同種のオープン重みモデルの中央値は約 27 です。
機能 / 06
エージェント基盤向けの設計。推論の制御、ツール呼び出し、構造化出力、そして 100 万トークン規模のストリーミングに対応します。
既定で有効、強度レベルは調整できます。
ツールとツール選択に対応。各アクションの検証はアプリ側の責任です。
レスポンス形式を指定すれば、パース可能な JSON が返ります。
初回トークンまで 1.47 秒は中央値より速い一方、スループットは劣ります。
スクリーンショット、図、画面録画をプロンプトに添付できます。
キャッシュ入力 $0.03 のおかげで、後続のやり取りも安く済みます。
比較 / 07
どちらも MIT 重みを公開する最前線ファミリーの低価格帯です。モダリティ、推論、ハードウェア要件で分かれます。
Z.ai
ハイブリッド KDA と NoPE スパース MLA アテンション。
ネイティブなマルチモーダル。
出力上限は提供元によって異なります。
ローンチ割引の適用前。
MIT ですが、マルチノード構成が必要です。
DeepSeek
既定では推論なし。
スクリーンショットは先に文字起こしが必要。
応答に使える枠がはるかに大きい。
一次提供元。1:2 とより緩やかな比率。
規模が小さく、運用コストも低め。
どちらも glm5.app のモデル一覧にあるため、同じプロンプトを両方で試せます。
リリースの経緯 / 08
匿名のステルスモデルとして 6 日間、その後オープン重みで正式公開されました。
`stealth/ox-alpha` が提供元非公開のまま OpenRouter に出現、トークン課金は無料でした。
利用量上位 5 つはいずれもエージェント型コーディングツール。OpenCode は無料提供しました。
Z.ai が Ox Alpha との同一性を認め、モデルカード・MIT 重み・料金が同時に公開されました。
SGLang 派生の独自エンジンで、約 3 倍と報告されています。ベンダーは非公表です。
`zai-org/GLM-5.3-Flash` に加え BF16 版と ModelScope ミラー。GitHub リポジトリはありません。
料金は OpenRouter、量子化は Hugging Face が最速。実地レポートは Reddit で今も Ox Alpha 名義です。
向いている人 / 09
最上位モデルの深さが不要な作業に最上位料金を払っているチーム向けです。合わない用途も挙げます。
GLM 5.3 の 10 分の 1 のトークン単価でツール呼び出しでき、長いエージェントループが現実的になります。
100 万トークンの文脈にコードベースを常駐させられるので、ファイル横断の質問に検索が要りません。
崩れたレイアウト、再現手順の録画、図として描かれたスキーマなど。
glm5.app のチャットで DeepSeek V4 Flash や Qwen と比べられます。
MIT 重みと vLLM 対応は本物ですが、FP8 で 328 GB は 1 台構成では無理です。
出力は毎秒約 50 トークンで、同価格帯の多くに後れを取ります。
方法は 3 つ。ブラウザでの無料チャット、glm5.app の API、または自前ハードウェアでの MIT 重み運用です。
チャットで GLM 5.3 Flash を選び、スクリーンショットを添付。新規アカウントには無料クレジットが付きます。
`https://glm5.app/api/v1` に OpenAI 互換リクエストを送り、モデル ID は `glm-5.3-flash` を指定します。
`zai-org/GLM-5.3-Flash` を取得し、SGLang か vLLM で配信します(FP8 で約 328 GB)。
Integration specimen
OpenAI 互換の Chat Completions エンドポイントです。`https://glm5.app/api/v1` でモデル ID `glm-5.3-flash` を指定してください。
API ドキュメントを開くcurl https://glm5.app/api/v1/chat/completions \
-H "Authorization: Bearer $GLM5_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": "Read this stack trace and name the failing call site."
}],
"stream": true
}'Ox Alpha、料金、ベンチマーク、パラメータ、Hugging Face、vLLM、DGX Spark、DeepSeek V4 Flash について。
はい。2026 年 8 月 20 日から 6 日間 `stealth/ox-alpha` として稼働していました。保存済みの Ox Alpha の会話は自動的に紐付け直されます。
いいえ。別のグレードで価格差はおよそ 10 倍です。Flash は 320B-A18B のマルチモーダルモデル、GLM 5.3 はテキストの旗艦モデルです。
Z.ai の定価は 100 万トークンあたり入力 $0.15、キャッシュ $0.03、出力 $0.50 です。引用される $0.075 / $0.25 は期間限定 50% オフです。
Ox Alpha のプレビュー期間は無料でしたが、現在は従量課金です。glm5.app のチャットでは今も無料で試せます。
総計 320B、1 トークンあたりアクティブ 18B、45 層が 288 個中 8 個のエキスパートにルーティングします。FP8 チェックポイントは約 328 GB です。
重みは Hugging Face の `zai-org/GLM-5.3-Flash` に MIT ライセンスで公開されています。専用の GitHub リポジトリはなく、レシピは `zai-org/GLM-5` にあります。
vLLM、SGLang、TokenSpeed、KTransformers に対応します。328 GB は DGX Spark 1 台には収まらず、4 ビットで 2 台つなぐ報告があります。
画像入力や熟考が必要なら Flash、比率 1:2 の緩やかさや 384K の出力枠が要るなら DeepSeek V4 Flash です。
実地の報告はプレビュー名で書かれたものが大半なので、Reddit では Ox Alpha で検索してください。
Start here
いちばん難しいタスクをブラウザで無料の GLM 5.3 Flash に通し、その後モデル ID をパイプラインに組み込みましょう。