AIREITER

AI画像

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 ProSeedream V5 liteSeedream V4.5もっと見る

AI動画

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0Grok Imagine 1.5Veo 3.1もっと見る

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 ProClaude Opus 5Claude Fable 5もっと見る
近日公開Seedance 2.5
Super ResolutionLyric Video GeneratorGPT Image 2 1K GeneratorGPT Image 2 Product Mockup GeneratorUse GPT-5.6 Online
APIドキュメント料金
ブログ更新LLM API GuideClaude API GuideKimi K3 API Guide
テンプレート
  • AIReiter
  • ブログ
  • DeepSeek V4 Flash vs GLM-5.2:0731アップデート後に4タスクで検証

DeepSeek V4 Flash vs GLM-5.2:0731アップデート後に4タスクで検証

最終更新日: 2026-07-31 07:33:58

DeepSeekが本日、deepseek-v4-flashをひそかに更新した。同一の4つの採点タスクでGLM-5.2と比較したところ、3つは同点、残る1つはFlashが勝利し、実行コストは19倍低かった。ただし、ベンチマーク上では依然としてGLM-5.2のほうが高性能だ。今回GLM-5.2が4つ目のタスクを落とした理由は、意図して踏める落とし穴にある。

その落とし穴とは、推論用のトークン予算だ。今回利用したエンドポイントでは、GLM-5.2は短いプロンプトにも長く推論する傾向があった。仕様が細かいタスクの1つでは、16,000出力トークンを使い切っても回答本文を一切返さなかった。一方のFlashは、同じタスクを2,525トークンで完了した。

deepseek-v4-flashの0731更新で変わったこと

DeepSeekのAPIドキュメントでは、deepseek-v4-flashのモデルバージョンがDeepSeek-V4-Flash-0731になっている。呼び出し方は従来どおりで、エイリアスも最新ビルドを指し続ける。そのためコードは壊れず、内部のモデルが切り替わったことも利用側には通知されない。

モデルバージョンDeepSeek-V4-Flash-0731、コンテキスト長1M、最大出力384Kを示すDeepSeek APIドキュメント

価格ページには今回の更新に関する変更履歴はなく、2026-07-31に確認したDeepSeekのニュース一覧にも2026年7月の項目はなかった。比較記事を読む際に重要なのはここだ。公開済みのFlashスコアは、その評価時点で稼働していたビルドを測っているにすぎない。評価日だけでなくモデルのバリアントも確認したい。「Flash Base」「Flash (Reasoning)」「Flash (Reasoning, Max Effort)」は、それぞれ別の数値を持つ異なる行だからだ。

同じドキュメントには、直接比較で重要な仕様も載っている。コンテキストは1M、最大出力は384K。thinking modeはデフォルトで有効で、非thinking modeも利用できる。並行実行上限はProの500に対して2,500だ。Responses APIが現在サポートするのはdeepseek-v4-flashのみで、deepseek-v4-proは2026年8月上旬の対応予定とされている。

4タスクを同条件で実行した結果

2026-07-31に、OpenAI互換のリレー経由で両モデルへ同一プロンプトを送った。thinkingはデフォルト設定のままとし、特記がない限りmax_tokensは8,000に設定した。出力は目視ではなく機械的に採点している。2つのコーディングタスクはそれぞれ6件・8件の非公開テストケースで実行し、JSONタスクは要求スキーマに対してキー単位で検証、検索タスクには正解文字列が1つだけある。

タスクDeepSeek V4 Flash (0731)GLM-5.2
t1 — 区間マージのエッジケースを特定して修正6/6テスト、5.0秒、出力3616/6テスト、19.0秒、出力990
t2 — 8ルール仕様のnext_version()を実装8/8テスト、29.9秒、出力2,525回答なし
t3 — 厳格なJSON、キー完全一致、フェンスなし合格、5.2秒、出力327合格、11.2秒、出力826
t4 — 約45Kトークンから3つの事実を検索・結合正解、5.2秒、出力172正解、9.7秒、出力317

4件中3件は、率直に言って同点だ。t1では両モデルとも、(1,4)と(4,5)のように端点が接する区間をマージできない、厳密な<比較のバグを見つけた。そして両者とも1文字の同じ修正を出した。厳格JSONタスクも両方が完全一致で通過。t4も、レコード211に埋め込まれた秘密とレコード1290のルールを組み合わせ、quartz-mallard-90を正しく返した。

DeepSeek V4 FlashとGLM-5.2のタスク別実測所要秒数を比較した集合棒グラフ

例外はt2で、ここは勝利宣言ではなく正確に記しておきたい。GLM-5.2は誤答したのではない。そもそも回答しなかった。8,000トークン上限では推論に8,000トークンをすべて使い、110秒後に空のcontentを返した。上限設定が原因ではないかを切り分けるため16,000でも再実行したが、16,000トークンを消費しても内容は空のまま、214秒だった。24,000での3回目は301秒後にエラーとなった。Flashは、ValueErrorを送出すべき3ケースを含む全8ケースに通る関数を生成した。

前提として明記しておく。この結果は1つのリレーエンドポイントで各タスクn=1を実行したものであり、ベンチマークではない。ここでは推論トークンもcompletion_tokensに含めて課金される一方、公式のZ.aiエンドポイントではストリーミングや計上方法が異なる可能性がある。このデータから言えるのは厳密な倍率ではなく傾向だ。GLM-5.2はタスクあたりのトークン消費量も実時間も大幅に多い。

能力面ではGLM-5.2が明確に強い領域

業界で実際に使われる評価指標で見れば、GLM-5.2のほうが強い。今回の結果を見て「安いモデルがすべてに勝つ」と読むのは誤りだ。Artificial AnalysisのIntelligence Indexでは、GLM-5.2 (max)は51、DeepSeek V4 Flash (Reasoning, Max Effort)は40で、差は11ポイントある。モデル規模もGLM-5.2は総パラメータ753B・アクティブ約40Bで、Flashの総284B・アクティブ13Bを大きく上回る。

Z.aiが公開しているGLM-5.2の数値も、フラッグシップモデルとして予想どおりの水準だ。SWE-bench Proは62.1%、Terminal-Bench 2.1は81.0、AIME 2026は99.2%、GPQA Diamondは91.2%、ツール利用時のHLEは54.7%。これらはベンダー公表値であり、Flashには大半の項目で比較可能な数値がない。

ベンチマークに関する実態は、この欠落に尽きる。両モデルが共通して受けている評価はほぼない。モデル追跡サイトbenchlmは両者を比較しているが、同条件の行がゼロであるとして勝者の判定を避けている。Flashの公開値はベースモデル向けスイートのものだ。MMLU 88.7%、HumanEval 69.5%、GSM8K 90.8%。対するGLM-5.2の値は、エージェント型コーディングのスイートから来ている。

両者が重なるのは知識カテゴリだけで、benchlmではGLM-5.2が59.6、Flashが56.4とGLM-5.2が上回る。この対決について比較ページごとに結論が異なるなら、通常は別バリアントを別スイートで評価しているためだ。利用予定のモデルと日付に一致する数値を信頼すべきである。

実務ユーザーの見方も、今回の測定結果と同じ方向を示している。両モデルに同一タスクを実行させたr/opencodeCLIのスレッドから引用する。

GLM 5.2 reasons hard on everything. V4 scales it, almost no wind-up on the simple fix, GLM 5.2 pulls ahead on anything that is not banally [simple] …

要するにこういうトレードオフだ。GLM-5.2の強い推論は難問では武器になるが、簡単な問題では純粋なオーバーヘッドにもなる。

価格表以上に開く実コスト差

まずはリスト価格から確認しよう。いずれも2026-07-31に各ベンダー公式ページで確認した。

100万トークンあたりDeepSeek V4 FlashGLM-5.2GLM倍率
入力(キャッシュミス)$0.14$1.4010.0x
入力(キャッシュヒット)$0.0028$0.2692.9x
出力$0.28$4.4015.7x
最大出力384K128K—
キャッシュヒット$0.0028、キャッシュミス$0.14、出力$0.28(100万トークンあたり)を示すDeepSeek APIドキュメントの価格表 GLM-5.2の料金として入力$1.4、キャッシュ入力$0.26、出力$4.4(100万トークンあたり)を示すZ.ai価格表

この料金を4タスクで実際に各モデルが使ったトークンへ当てはめると、差は出力単価の15.7倍を超えて広がる。高価なモデルのほうが、出力も多いからだ。

タスクFlash 入力→出力FlashコストGLM-5.2 入力→出力GLM-5.2コスト倍率
t1 バグ修正165→361$0.000124170→990$0.00459437.0x
t2 実装182→2,525$0.000732196→16,000$0.07067496.5x
t3 厳格JSON171→327$0.000116177→826$0.00388233.5x
t4 長文コンテキスト45,225→172$0.00638044,164→317$0.0632249.9x
4タスク合計45,743→3,385$0.00735244,707→18,133$0.14237519.4x

すべてのプロンプトはコールド状態で送信したため、入力はすべてキャッシュミス料金で計算している。上表の各値は、ひとつ前の料金表の単価を掛ければ再現できる。

GLM-5.2コストをDeepSeek V4 Flashコストで割ったタスク別倍率を示す棒グラフ。範囲は9.9倍から96.5倍

最も差が小さいのはt4の9.9倍だ。入力トークンの比重が大きい仕事では、10倍の入力単価差が支配的になり、出力の冗長さは効きにくくなる。GLM-5.2のプレミアムが比較的抑えられるのは、このタイプのワークロードである。

DeepSeekの料金ページには、北京時間(UTC+8)の09:00〜12:00および14:00〜18:00について、全請求項目を2xとするピーク・オフピーク料金をAPIに「まもなく」導入するとある。適用日は今後発表される予定だ。これが導入されれば、アジアの営業時間中におけるFlashの出力単価優位はおよそ5倍まで縮む。一方で、Flashのキャッシュヒット入力は$0.0028で、GLM-5.2の$0.26より93倍安い。大きく安定したプレフィックスを繰り返し使うなら、差はさらに広がる。コーディング用途に限れば、Z.aiにはGLM-5.2を含み、オフピーク利用が半額となる月額$18からのCoding Planもある。これは上記のトークン従量課金とは別の請求体系だ。

ワークロード別:どちらを呼ぶべきか

ワークロード推奨理由
大量のシンプル〜中程度のコード修正V4 Flasht1ではGLM-5.2と同じ回答で、3.8倍高速、37倍安価
大規模な厳格フォーマット/構造化出力V4 Flashバイト単位で同一の結果を1/34のコストで得られた
大きな文書を対象にした長文コンテキスト検索V4 Flash同じ正解。コスト差は最小だが、それでも9.9倍
難しいエージェント型または複数ファイルのコーディングGLM-5.2Intelligence Indexは51対40で、強みはエージェント型スイートで示されている
max_tokensが厳しいあらゆる用途V4 Flash今回のt2でGLM-5.2は8K・16K上限のどちらでも回答を返さなかった
1回の呼び出しで128Kトークンを超える出力V4 FlashGLM-5.2の最大128Kに対し、最大出力は384K

これは確定したルールではなく、1回・4タスクの実行結果に基づく、検証すべきコストルーティングの初期値として扱ってほしい。基本はFlashへ送り、誤答の損失がトークン支出の19倍を超える一部のタスクでGLM-5.2へエスカレーションするのがよい。GLM-5.2を使うなら、十分な余裕を持たせたい。Flashなら余裕のある上限でも、課金だけ発生して回答が返らない可能性がある。

この比較だけでは判断できない点もある。0731が本日公開された後、Flashを第三者が再評価した結果はまだ出ていない。したがって51対40の差が示すのは4月ビルド同士の距離だ。現行モデルの能力差は未測定であり、自分のワークロードにおける差を測るには、両エイリアスを対象に独自評価を走らせるしかない。

FAQ

DeepSeek V4 Flash 0731は新モデル、それともアップデート?

新モデルではなく、既存モデルのアップデートだ。DeepSeekのドキュメントではバージョンがDeepSeek-V4-Flash-0731とされ、呼び出し方法は変わらない。つまり、利用側でコードを変えなくてもdeepseek-v4-flashは最新ビルドを参照し続ける。

DeepSeek V4 FlashはGLM-5.2に勝った?

能力面では勝っていない。Artificial AnalysisではGLM-5.2 (max)が51、DeepSeek V4 Flash (Reasoning, Max Effort)が40だ。一方、解決できたタスクあたりのコストではFlashが勝った。4つの採点タスクのうち3つで同点となり、総コストは19.4倍低かった。

GLM-5.3はもう出ている?

2026-07-31時点では出ていない。Z.ai公式の価格表とCoding Planのモデル一覧ではGLM-5.2が最新で、どちらにも5.3の行はない。

100万トークンのコンテキストを扱う仕事では、どちらが安い?

DeepSeek V4 Flashだ。キャッシュミス入力では10倍、キャッシュヒット入力では93倍安い。約45Kトークンの検索タスクでは、Flashが$0.006380、GLM-5.2が$0.063224だった。

Claude Codeで両方使える?

使える。両ベンダーともAnthropic形式のエンドポイントを案内している。DeepSeekはOpenAI形式のベースURLとともにhttps://api.deepseek.com/anthropicを掲載している。Z.aiのClaude Codeガイドでは、ANTHROPIC_BASE_URLをhttps://api.z.ai/api/anthropicに設定し、SonnetとOpusのスロットをglm-5.2[1m]へマッピングする。

関連記事

  • DeepSeek V4 Flash vs DeepSeek V4 Pro
  • GLM-5.2 API

出典

  • DeepSeek Models & Pricing — 0731のバージョン注記、料金、ピーク・オフピーク方針。2026-07-31確認
  • Z.ai pricing — GLM-5.2料金。2026-07-31確認
  • Z.ai Coding Plan — サブスクリプション階層とGLM-5.2の対象範囲。2026-07-31確認
  • Z.ai: Claude Code setup — Anthropic互換ベースURLとモデルマッピング
  • DeepSeek news index — 2026-07-31確認。2026年7月の項目なし
  • Artificial Analysis: GLM-5.2 vs DeepSeek V4 Flash — Intelligence Index、パラメータ数
  • benchlm: DeepSeek V4 Flash Base vs GLM-5.2 — 共通ベンチマークのカバレッジ、知識スコア
  • r/opencodeCLI: DeepSeek V4 vs GLM 5.2 for coding — 実務ユーザーのレポート

>_AIReiter モデルディレクトリ

このガイドに関連するモデルへ素早く API アクセス

Kimi K3

Chat

コーディング、文章作成、分析、エージェントワークフロー向けの長文脈推論モデル。

moonshotAPI Key を作成 >

Gemini 3.6 Flash

Chat

高度な推論、コーディング、エージェントタスク向けの高速なGeminiモデルです。

GoogleAPI Key を作成 >

Claude Fable 5

Chat

深い推論と複雑な長文作業向けのプレミアムClaudeモデルです。

AnthropicAPI Key を作成 >

Claude Opus 4.8

Chat

高度な推論やプロフェッショナルな作業に対応する高性能なClaudeモデルです。

AnthropicAPI Key を作成 >

Claude Opus 5

Chat

複雑な推論、コーディング、長文コンテキストの専門的な作業向けのプレミアムなClaudeモデルです。

anthropicAPI Key を作成 >

最近の記事

GPT-5.6値下げ後の料金を検証:Luna・Terraの実コストはどう変わったか

2026-07-31

Invalid API Keyの直し方:401と403を切り分けてから対処する

2026-07-31

OpenRouterの429を解決:Provider Errorかレート制限かを見分ける

2026-07-31

B2B広告インテリジェンスはHTMLを読むしかない:リニューアルに耐えるパーサーの作り方

2026-07-31
AIREITER

ご質問はお問い合わせください
[email protected]

LLM

Gemini 3.6 FlashGemini 3.1 ProKimi K3Gemini 3 ProGemini 2.5 Pro

AI動画

Kling 3.0 Motion ControlSora 2 ProKling 3.0 TurboSora 2Kling 3.0

AI画像

FLUX.2 ProGPT-Image 2Wan 2.7 Image ProGPT 4o ImageSeedream 5.0 Pro

ブログ

すべて表示 →

会社

プライバシーポリシー利用規約返金ポリシー

© 2026 AIReiter. All rights reserved.