AIREITER

GPT-5.6 Luna vs DeepSeek V4 Pro:両APIを同一プロンプトで検証

最終更新日: 2026-08-10 10:52:51

同じプロンプトを投げるなら、GPT-5.6 LunaとDeepSeek V4 Proのどちらを選ぶべきか。今回のAPIテストでは、両モデルとも3問中3問を正解した。能力差だけで決められる比較ではない。実際に効いてくるのは価格体系とレイテンシだ。しかもDeepSeekは公式料金ページで、大幅な値上げを予定していると明記している。2026年8月10日時点で測定・確認できた内容をもとに、選び方を整理する。

同一プロンプトでAPIを比較した結果

2026年8月10日、同じAPIパイプラインからGPT-5.6 LunaとDeepSeek V4 Proへ、デフォルト設定のまま同一の3タスクを送信した。内容は、あえて短い指示でのPythonバグ修正(「修正済みの関数だけを返すこと」)、正答が10:10に一意に定まる3ドックのトラック配送スケジューリング問題、nullableフィールドを含む厳格なJSON抽出だ。結果は両モデルとも全問正解だった。

タスクGPT-5.6 LunaDeepSeek V4 Pro
Python merge_intervalsのバグ修正正解(max()による修正)、10.7秒正解(max()による修正)、16.1秒
ドックスケジューリングの推論正解(10:10)、8.0秒正解(10:10)、27.2秒
厳格なJSON抽出有効、スキーマ完全準拠、3.0秒有効、スキーマ完全準拠、7.6秒
3つの同一プロンプトにおけるGPT-5.6 LunaとDeepSeek V4 Proのレイテンシ比較

押さえておきたい注意点が2つある。まず、これは3タスクだけのスポットチェックであり、ベンチマークではない。次に、V4 Proはデフォルトでthinking modeが有効だ。今回の2〜3倍のレイテンシ差の大半はこれで説明できる。リクエスト単位で無効化できるが、難しい推論の性能はある程度落ちる。指示追従にも差があり、Lunaは要求どおり関数だけを返した一方、V4 ProはMarkdownのコードフェンスで囲んで返した。チャット画面なら問題ないが、パイプラインでは解析処理が1段増える。安定性を確認するためスケジューリング問題を1回再実行したところ、両モデルとも再び10:10と答えた。

公式料金を確認:DeepSeekには値上げ予告もある

両社の公式ページを2026年8月10日に確認した。GPT-5.6 Lunaは入力100万トークンあたり$0.20、キャッシュ入力は$0.02、出力は$1.20(OpenAI model page)。DeepSeek V4 Proは、キャッシュミス時の入力が100万トークンあたり$0.435、キャッシュヒット時が$0.003625、出力が$0.87だ(DeepSeek pricing page)。

GPT-5.6 LunaとDeepSeek V4 Proの公式API料金(100万トークンあたり)比較

つまり、どちらか一方が常に安いわけではない。キャッシュされていない入力ならLunaが54%安く、出力ならV4 Proが27%安い。キャッシュヒット時の入力はV4 ProがLunaより5.5倍安い。どちらが有利かは、トークンの内訳で変わる。

  • 対話型チャット(1回あたり入力1K+出力500):Lunaは$0.0008、V4 Proは$0.00087。実質的にはほぼ同額。
  • リポジトリレビュー(新規入力50K+出力3K):Lunaは$0.0136、V4 Proは$0.0244。Lunaが44%安い。
  • エージェントループ(反復ごとにキャッシュ入力200K+新規入力20K+出力10K):Lunaは$0.020、V4 Proは$0.018。ここではV4 Proが上回り、キャッシュ済みの反復が増えるほど差は広がる。
料金とコンテキストウィンドウを掲載したGPT-5.6 Lunaの公式モデルページ

ただし、この試算がいつまで有効かを左右する事実がある。DeepSeekの料金ページにある脚注2には、「近い将来、DeepSeek APIサービス全体の価格を引き上げる予定であり、大幅な値上げが見込まれる」と記載されている。日付も価格も示されていない。それでも、V4 Proを価格で選ぶなら、この公式の注意書きは無視できない。一方のLunaは、OpenAIによる8月のGPT-5.6値下げと同時に登場している。

値上げに関する脚注を含むDeepSeek V4 Proの公式料金表

キャッシュ中心の処理ではV4 Proが強い

キャッシュ入力100万トークンあたりの料金は、DeepSeek V4 Proが$0.003625、Lunaが$0.02で、5.5倍の差がある。毎回長く変わらないプレフィックスを読み直すエージェントワークロードでは、この差がコストを大きく左右する。実際にエージェントを運用する開発者からも、こうした点は注目されている。

DeepSeek v4 Pro & MiMo v2.5 Pro ... are insanely cheap for agent-driven work due to their super low cached-input prices ($0.0036/mtok). For Luna, the cached-input price ... the pricing page puts it at $0.02/mtok, & that's 5x more expensive. — Hacker News commenter, on the GPT-5.6 launch thread

Lunaではキャッシュ書き込みの追加料金にも注意したい。キャッシュ書き込みは非キャッシュ入力料金の1.25倍で課金される(OpenAI model page)。また、入力が272Kトークンを超えるプロンプトでは、リクエスト全体に対して入力が2倍、出力が1.5倍の料金になる。エージェントのコンテキストが272Kトークンを恒常的に超えるなら、V4 Proのキャッシュ優位が最も強くなる場面で、Lunaの実効料金はおおむね倍になる。

コスト試算の前に公式ドキュメントで料金を確認する

この比較を調べるなかで、第三者サイトにはV4 Proの入力料金を100万トークンあたり$0.435から$1.74まで幅広く掲載した例があり、Lunaのコンテキストウィンドウも400Kから1.05Mまでばらついていた。確認にかかる時間は1分もない。料金は上記の公式2ページだけで確認すること、モデルバージョン文字列を確認すること(現在のAPIはDeepSeek-V4-Proを提供しており、Flashは-0731に固定されている)、そして引用されている「入力料金」がキャッシュヒット時かミス時かを確認すること。この最後の点は重要で、V4 Proでは両者に120倍の差がある。

用途の向き不向きを決める仕様差

価格以外では、最大出力、モダリティ、オープン性、APIの提供範囲という4つの仕様差が用途を分ける。両モデルともおよそ100万トークンのコンテキストウィンドウを掲げているため、コンテキスト長だけでは選別できない(Lunaは1,050,000トークン、V4 Proは1M)。

仕様(2026年8月10日確認)GPT-5.6 LunaDeepSeek V4 Pro
コンテキストウィンドウ1,050,0001M
最大出力トークン数128K384K
入力モダリティテキスト+画像テキストのみ
推論の制御Effortレベル(low→max)Thinkingオン(デフォルト)/オフ
オープンウェイトいいえはい(セルフホスト可能)
Responses APIはい未対応(公式情報:2026年8月上旬)
同時実行数の上限利用ティアに応じる500
知識カットオフ2026年2月16日料金ページには記載なし

V4 Proの最大出力は384Kトークンで、Lunaの128Kの3倍だ。チャンク分割が失敗要因になりやすい、単発でのコードベース生成、長文翻訳、大規模な構造化抽出では重要になる。一方、Lunaの画像入力は別の理由で価値がある。DeepSeekの利用者も、指示されずともこの点を挙げている。

My only real complaint is that they can't do images, which limits their ability to autonomously debug some kinds of issues. — Hacker News commenter, on running DeepSeek for hobby projects

オープンウェイトという点ではV4 Proが逆に有利だ。ダウンロードしてセルフホストできるため、データレジデンシー要件がある場合、この比較ではV4 Proだけが選択肢になる。ただし、この規模のモデルを提供するには本格的なマルチGPUハードウェアが必要で、週末に手軽に構築できるものではない。

ベンチマークはモデル差よりEffortモードの影響が大きい

GPT-5.6 LunaとDeepSeek V4 Proの公開スコアは、各モデルをどのEffortモードで測ったかによって勝者が入れ替わる。たとえば、Lunaをlow effort、V4 Proをmaxで動かしたあるトラッカーでは33.3対44.3でV4 Proが勝つ。一方、両方をmaxで実行するArtificial Analysisでは52対45でLunaが勝つ。どちらかが誤りなのではなく、測っている構成が違う。

レイテンシの数字にも同じ落とし穴がある。Artificial Analysisは、Lunaのmax effort時における最初の回答トークンまでの時間を132秒と報告している。max effortでは、Lunaは回答前におよそ2分考えることになる。デフォルト設定で行った今回のテストでは、Lunaは3〜10.7秒で応答した。どちらも実測値だが、本番構成に近いのは片方だけだ。出力を始めてからのスループットはLunaが明確に優位で、202トークン/秒に対して78トークン/秒となっている(Artificial Analysis)。

Effortモードは同一モデルのスコアも大きく動かす。V4 ProはGPQA Diamondでmax thinking時に90.1%を記録するが、thinkingをオフにすると72.9%だ。両モデルをmax effortで比べたベンチマークでは、SWE-Bench ProはLunaが62.7%対55.4%でリードし、BrowseCompは83.3対83.4でほぼ同点となる。スコアカードを信頼する前に、3点を確認したい。どのEffortモードか、レイテンシにthinking時間が含まれるか、そしてベンチマークのバージョンは同一かだ。あるトラッカーにおけるTerminal-Benchの84.7対67.9という差は、v2.1とv2.0を比較している。

結局、どちらを使うべきか

ユーザー向けプロダクトならGPT-5.6 Lunaを選びたい。今回のデフォルト設定テストでは3タスクすべてで2〜3倍高速で、非キャッシュ入力の価格はV4 Proの半額、画像入力にも対応する。キャッシュを多用するエージェントループ、128Kトークンを超える出力、自社ハードウェアでの実行が必要な用途ならDeepSeek V4 Proが向く。ただし、長期契約を考えるなら、公式の値上げ予告をコストに織り込むべきだ。GPT-5.6 LunaとDeepSeek V4 Proはエンドポイントを切り替えるだけで試せるため、導入前に自分のワークロードで今回の3プロンプトを再実行してみるとよい。

ワークロード選択決め手
チャットボット、ユーザー向けアプリLuna今回のテストで3.0〜10.7秒、V4 Proは7.6〜27.2秒。202対78トークン/秒
新規入力を大量処理する用途Luna非キャッシュ入力100万トークンあたり$0.20対$0.435
固定コンテキストを繰り返すエージェントループV4 Proキャッシュ入力100万トークンあたり$0.003625対$0.02
単発での長大な出力V4 Pro最大出力384K対128K
画像対応(スクリーンショット、画像化したPDF)LunaV4 Proはテキスト専用
セルフホスティング/データレジデンシーV4 Proオープンウェイト。LunaはAPI専用
2027年までの予算確実性LunaDeepSeekが公式に値上げを告知

FAQ

GPT-5.6 LunaとDeepSeek V4 Proはどちらが安い?

一概には言えない。非キャッシュ入力はLunaが54%安く、100万トークンあたり$0.20対$0.435。キャッシュ入力はV4 Proが5.5倍安く、$0.003625対$0.02で、出力もV4 Proが27%安い($0.87対$1.20)。キャッシュを多用するエージェントはV4 Pro、新規入力中心のワークロードはLunaのほうが低コストになる。

両モデルとも100万トークンのコンテキストウィンドウに対応している?

対応している。Lunaは1,050,000トークン、V4 Proは1Mトークンだ。ただしLunaは、入力が272Kトークンを超えるリクエストでは、リクエスト全体に入力2倍・出力1.5倍の料金が適用される。

DeepSeek V4 Proはオープンソースで、セルフホストできる?

できる。V4 Proはオープンウェイトとして提供され、API専用のLunaと異なりセルフホスト可能だ。ただし、単一ワークステーションではなく、マルチGPUのサービング用ハードウェアを前提に考えたい。

GPT-5.6 Lunaは画像入力に対応している?

対応している。Lunaはテキストと画像を入力できる。DeepSeek V4 Proはテキスト専用で、同モデルの利用者は自律デバッグのワークフローにおける主な制約として画像対応の欠如を挙げている。

各モデルの最大出力トークン数は?

DeepSeek V4 Proは1レスポンスあたり最大384Kトークン、GPT-5.6 Lunaは最大128Kトークンを出力できる。長い文書や大規模なコードファイルを単発生成する用途では、V4 Proの上限は3倍高い。

関連記事