GLM 5.3 Flash

GLM 5 ファミリーにおける Z.ai の効率重視モデル。総パラメータ 320B・アクティブ 18B の Mixture-of-Experts で、テキスト・画像・動画入力、100 万トークン文脈、MIT のオープン重みを備えます。

GLM 5 で作成する

GLM 5.3 Flash とは?

GLM 5.3 Flash は 2026 年 8 月 26 日に公開されました。その前の 6 日間は、OpenRouter でステルスモデル Ox Alpha として動いていました。

01

総計 320B、アクティブ 18B

1 トークンあたり発火するのは 288 個中 8 個のエキスパートだけ。メモリは 320B、計算量は 18B 相当です。

02

ネイティブなマルチモーダル

視覚能力は 30T トークンの事前学習コーパス由来で、後付けのエンコーダーではありません。

03

Flash は「速い」ではなく「安い」

Artificial Analysis の計測では出力 50.2 トークン/秒で、同クラス中央値の 67 t/s を下回ります。

GLM 5.3 Flash のスペック・サイズ・オープンソース状況

アーキテクチャ、重み、ライセンスは Hugging Face のモデルカードと zai-org/GLM-5 リポジトリに基づきます。

モデルカード

アーキテクチャ

総パラメータ数
320B

MoE、45 層、288 個中 8 個のエキスパート。

アクティブパラメータ数
18B

18B の密モデルと同等の計算量。

コンテキストウィンドウ
1,048,576 トークン

Io Net は 262,144、Cloudflare は 1,310,720 が上限。

最大出力
131,072 トークン

最大 1,179,648 と記載する提供元もあります。

対応モダリティ
テキスト・画像・動画

入力はマルチモーダル、出力はテキスト。

重みとライセンス

サイズとライセンス

重みのライセンス
MIT

商用利用も再配布も可、しきい値なし。

Hugging Face
zai-org/GLM-5.3-Flash

-BF16 版と ModelScope ミラーもあります。

GitHub
zai-org/GLM-5

単独リポジトリはなし。GLM-5 は Apache-2.0。

チェックポイント容量
約 328 GB (FP8)

ワークステーションではなくマルチノード構成が前提。

サービングスタック
SGLang, vLLM

TokenSpeed、KTransformers、コミュニティ製 GGUF も対応。

モデルカードおよび OpenRouter の endpoints API、2026 年 8 月時点。

料金 / 04

GLM 5.3 Flash の料金:定価とローンチ割引

Z.ai の定価は 100 万トークンあたり入力 $0.15、出力 $0.50 です。各所で引用される $0.075 / $0.25 は期間限定 50% オフのローンチ割引です。

01

定価

$0.15

入力 100 万トークンあたり

GLM 5.3 Flash のコスト試算は割引価格ではなくこちらを基準に。

02

定価

$0.50

出力 100 万トークンあたり

1:3.3 という急な比率。まず出力量に上限を設けましょう。

03

定価

$0.03

キャッシュ入力 100 万トークンあたり

新規入力の 5 分の 1。長い文脈を現実的なコストにする要因です。

04

第三者計測

$0.10

ブレンド価格

Artificial Analysis による、キャッシュ・入力・出力 7:2:1 の想定。

同一の重みでも価格差は 2 倍。Z.AI、Novita、GMICloud は割引、他は定価です。

ベンチマーク / 05

GLM 5.3 Flash のベンチマーク:ベンダー公表値と第三者計測

Z.ai は自社の表を公開し、比較対象も自ら選んでいます。GLM 5.2 との差分と Artificial Analysis の数値は検証に耐えます。

01

Z.ai 公表

Terminal-Bench 2.1

5.3 Flash84.3
Opus 4.885.0

GPT-5.6 Terra は 87.4。難易度が上がるほど差は開きます。

02

Z.ai 公表

DeepSWE v1.1

5.3 Flash63.4
GLM 5.246.2

同じ系列・同じ手法で価格は 10 分の 1。AutomationBench は 48.8 対 26.2。

03

Z.ai 公表

OfficeQA Pro

5.3 Flash62.4

文書と視覚の推論。Opus 4.8 を上回るとされています。

04

Artificial Analysis

57

Intelligence Index

第三者計測。同種のオープン重みモデルの中央値は約 27 です。

GLM 5.3 Flash の最も信頼できるベンチマークは、自分のバックログです。

機能 / 06

GLM 5.3 Flash でできること

エージェント基盤向けの設計。推論の制御、ツール呼び出し、構造化出力、そして 100 万トークン規模のストリーミングに対応します。

01

推論の強度を制御

既定で有効、強度レベルは調整できます。

02

Function calling

ツールとツール選択に対応。各アクションの検証はアプリ側の責任です。

03

構造化出力

レスポンス形式を指定すれば、パース可能な JSON が返ります。

04

ストリーミング応答

初回トークンまで 1.47 秒は中央値より速い一方、スループットは劣ります。

05

画像・動画入力

スクリーンショット、図、画面録画をプロンプトに添付できます。

06

100 万トークンの文脈

キャッシュ入力 $0.03 のおかげで、後続のやり取りも安く済みます。

比較 / 07

GLM 5.3 Flash と DeepSeek V4 Flash

どちらも MIT 重みを公開する最前線ファミリーの低価格帯です。モダリティ、推論、ハードウェア要件で分かれます。

Z.ai

GLM 5.3 Flash

アーキテクチャ
320B / アクティブ 18B

ハイブリッド KDA と NoPE スパース MLA アテンション。

入力
テキスト・画像・動画

ネイティブなマルチモーダル。

文脈 / 出力
1M / 131K

出力上限は提供元によって異なります。

定価
$0.15 / $0.50

ローンチ割引の適用前。

セルフホスト
約 328 GB FP8

MIT ですが、マルチノード構成が必要です。

DeepSeek

DeepSeek V4 Flash

アーキテクチャ
284B / アクティブ約 13B

既定では推論なし。

入力
テキストのみ

スクリーンショットは先に文字起こしが必要。

文脈 / 出力
1M / 384K

応答に使える枠がはるかに大きい。

定価
$0.14 / $0.28

一次提供元。1:2 とより緩やかな比率。

セルフホスト
MIT 重み

規模が小さく、運用コストも低め。

どちらも glm5.app のモデル一覧にあるため、同じプロンプトを両方で試せます。

リリースの経緯 / 08

GLM 5.3 Flash のリリース経緯:Ox Alpha からオープン重みまで

匿名のステルスモデルとして 6 日間、その後オープン重みで正式公開されました。

01

8 月 20 日 — Ox Alpha が登場

`stealth/ox-alpha` が提供元非公開のまま OpenRouter に出現、トークン課金は無料でした。

02

8 月 20〜26 日 — エージェント系ツールが殺到

利用量上位 5 つはいずれもエージェント型コーディングツール。OpenCode は無料提供しました。

03

8 月 26 日 — GLM 5.3 Flash が公開

Z.ai が Ox Alpha との同一性を認め、モデルカード・MIT 重み・料金が同時に公開されました。

04

プレビューは中国製チップ上で稼働

SGLang 派生の独自エンジンで、約 3 倍と報告されています。ベンダーは非公表です。

05

重みは Hugging Face で公開

`zai-org/GLM-5.3-Flash` に加え BF16 版と ModelScope ミラー。GitHub リポジトリはありません。

06

情報が最初に出る場所

料金は OpenRouter、量子化は Hugging Face が最速。実地レポートは Reddit で今も Ox Alpha 名義です。

向いている人 / 09

GLM 5.3 Flash は誰のためのモデルか

最上位モデルの深さが不要な作業に最上位料金を払っているチーム向けです。合わない用途も挙げます。

01

大量に回すエージェント型コーディング

GLM 5.3 の 10 分の 1 のトークン単価でツール呼び出しでき、長いエージェントループが現実的になります。

02

リポジトリ規模の作業

100 万トークンの文脈にコードベースを常駐させられるので、ファイル横断の質問に検索が要りません。

03

画面を見せるデバッグ

崩れたレイアウト、再現手順の録画、図として描かれたスキーマなど。

04

Z.ai と他社を比較検討するチーム

glm5.app のチャットで DeepSeek V4 Flash や Qwen と比べられます。

05

クラスタを持つセルフホスト勢

MIT 重みと vLLM 対応は本物ですが、FP8 で 328 GB は 1 台構成では無理です。

06

低レイテンシ必須の UI には不向き

出力は毎秒約 50 トークンで、同価格帯の多くに後れを取ります。

GLM 5.3 Flash の使い方 / 10

GLM 5.3 Flash の使い方

方法は 3 つ。ブラウザでの無料チャット、glm5.app の API、または自前ハードウェアでの MIT 重み運用です。

01
01

GLM 5.3 Flash と無料でチャット

チャットで GLM 5.3 Flash を選び、スクリーンショットを添付。新規アカウントには無料クレジットが付きます。

02
02

glm5.app の API を呼び出す

`https://glm5.app/api/v1` に OpenAI 互換リクエストを送り、モデル ID は `glm-5.3-flash` を指定します。

03
03

あるいは重みを自前で動かす

`zai-org/GLM-5.3-Flash` を取得し、SGLang か vLLM で配信します(FP8 で約 328 GB)。

Integration specimen

GLM 5.3 Flash API を使い始める

OpenAI 互換の Chat Completions エンドポイントです。`https://glm5.app/api/v1` でモデル ID `glm-5.3-flash` を指定してください。

API ドキュメントを開く
Request previewcurl
curl https://glm5.app/api/v1/chat/completions \
  -H "Authorization: Bearer $GLM5_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{
      "role": "user",
      "content": "Read this stack trace and name the failing call site."
    }],
    "stream": true
  }'

GLM 5.3 Flash のよくある質問

Ox Alpha、料金、ベンチマーク、パラメータ、Hugging Face、vLLM、DGX Spark、DeepSeek V4 Flash について。

GLM 5.3 Flash は Ox Alpha と同じモデルですか?

はい。2026 年 8 月 20 日から 6 日間 `stealth/ox-alpha` として稼働していました。保存済みの Ox Alpha の会話は自動的に紐付け直されます。


GLM 5.3 Flash は GLM 5.3 と同じですか?

いいえ。別のグレードで価格差はおよそ 10 倍です。Flash は 320B-A18B のマルチモーダルモデル、GLM 5.3 はテキストの旗艦モデルです。


GLM 5.3 Flash の料金は?

Z.ai の定価は 100 万トークンあたり入力 $0.15、キャッシュ $0.03、出力 $0.50 です。引用される $0.075 / $0.25 は期間限定 50% オフです。


GLM 5.3 Flash は無料ですか?

Ox Alpha のプレビュー期間は無料でしたが、現在は従量課金です。glm5.app のチャットでは今も無料で試せます。


GLM 5.3 Flash のパラメータ数とサイズは?

総計 320B、1 トークンあたりアクティブ 18B、45 層が 288 個中 8 個のエキスパートにルーティングします。FP8 チェックポイントは約 328 GB です。


GLM 5.3 Flash は Hugging Face や GitHub にありますか?

重みは Hugging Face の `zai-org/GLM-5.3-Flash` に MIT ライセンスで公開されています。専用の GitHub リポジトリはなく、レシピは `zai-org/GLM-5` にあります。


vLLM や DGX Spark で GLM 5.3 Flash を動かせますか?

vLLM、SGLang、TokenSpeed、KTransformers に対応します。328 GB は DGX Spark 1 台には収まらず、4 ビットで 2 台つなぐ報告があります。


GLM 5.3 Flash と DeepSeek V4 Flash はどちらを使うべき?

画像入力や熟考が必要なら Flash、比率 1:2 の緩やかさや 384K の出力枠が要るなら DeepSeek V4 Flash です。


Reddit では GLM 5.3 Flash はどう評価されていますか?

実地の報告はプレビュー名で書かれたものが大半なので、Reddit では Ox Alpha で検索してください。


Start here

今日から GLM 5.3 Flash を使う

いちばん難しいタスクをブラウザで無料の GLM 5.3 Flash に通し、その後モデル ID をパイプラインに組み込みましょう。