同じプロンプトを投げるなら、GPT-5.6 LunaとDeepSeek V4 Proのどちらを選ぶべきか。今回のAPIテストでは、両モデルとも3問中3問を正解した。能力差だけで決められる比較ではない。実際に効いてくるのは価格体系とレイテンシだ。しかもDeepSeekは公式料金ページで、大幅な値上げを予定していると明記している。2026年8月10日時点で測定・確認できた内容をもとに、選び方を整理する。
同一プロンプトでAPIを比較した結果
2026年8月10日、同じAPIパイプラインからGPT-5.6 LunaとDeepSeek V4 Proへ、デフォルト設定のまま同一の3タスクを送信した。内容は、あえて短い指示でのPythonバグ修正(「修正済みの関数だけを返すこと」)、正答が10:10に一意に定まる3ドックのトラック配送スケジューリング問題、nullableフィールドを含む厳格なJSON抽出だ。結果は両モデルとも全問正解だった。
| タスク | GPT-5.6 Luna | DeepSeek V4 Pro |
|---|---|---|
Python merge_intervalsのバグ修正 | 正解(max()による修正)、10.7秒 | 正解(max()による修正)、16.1秒 |
| ドックスケジューリングの推論 | 正解(10:10)、8.0秒 | 正解(10:10)、27.2秒 |
| 厳格なJSON抽出 | 有効、スキーマ完全準拠、3.0秒 | 有効、スキーマ完全準拠、7.6秒 |
押さえておきたい注意点が2つある。まず、これは3タスクだけのスポットチェックであり、ベンチマークではない。次に、V4 Proはデフォルトでthinking modeが有効だ。今回の2〜3倍のレイテンシ差の大半はこれで説明できる。リクエスト単位で無効化できるが、難しい推論の性能はある程度落ちる。指示追従にも差があり、Lunaは要求どおり関数だけを返した一方、V4 ProはMarkdownのコードフェンスで囲んで返した。チャット画面なら問題ないが、パイプラインでは解析処理が1段増える。安定性を確認するためスケジューリング問題を1回再実行したところ、両モデルとも再び10:10と答えた。
公式料金を確認:DeepSeekには値上げ予告もある
両社の公式ページを2026年8月10日に確認した。GPT-5.6 Lunaは入力100万トークンあたり$0.20、キャッシュ入力は$0.02、出力は$1.20(OpenAI model page)。DeepSeek V4 Proは、キャッシュミス時の入力が100万トークンあたり$0.435、キャッシュヒット時が$0.003625、出力が$0.87だ(DeepSeek pricing page)。
つまり、どちらか一方が常に安いわけではない。キャッシュされていない入力ならLunaが54%安く、出力ならV4 Proが27%安い。キャッシュヒット時の入力はV4 ProがLunaより5.5倍安い。どちらが有利かは、トークンの内訳で変わる。
- 対話型チャット(1回あたり入力1K+出力500):Lunaは$0.0008、V4 Proは$0.00087。実質的にはほぼ同額。
- リポジトリレビュー(新規入力50K+出力3K):Lunaは$0.0136、V4 Proは$0.0244。Lunaが44%安い。
- エージェントループ(反復ごとにキャッシュ入力200K+新規入力20K+出力10K):Lunaは$0.020、V4 Proは$0.018。ここではV4 Proが上回り、キャッシュ済みの反復が増えるほど差は広がる。
ただし、この試算がいつまで有効かを左右する事実がある。DeepSeekの料金ページにある脚注2には、「近い将来、DeepSeek APIサービス全体の価格を引き上げる予定であり、大幅な値上げが見込まれる」と記載されている。日付も価格も示されていない。それでも、V4 Proを価格で選ぶなら、この公式の注意書きは無視できない。一方のLunaは、OpenAIによる8月のGPT-5.6値下げと同時に登場している。
キャッシュ中心の処理ではV4 Proが強い
キャッシュ入力100万トークンあたりの料金は、DeepSeek V4 Proが$0.003625、Lunaが$0.02で、5.5倍の差がある。毎回長く変わらないプレフィックスを読み直すエージェントワークロードでは、この差がコストを大きく左右する。実際にエージェントを運用する開発者からも、こうした点は注目されている。
DeepSeek v4 Pro & MiMo v2.5 Pro ... are insanely cheap for agent-driven work due to their super low cached-input prices ($0.0036/mtok). For Luna, the cached-input price ... the pricing page puts it at $0.02/mtok, & that's 5x more expensive. — Hacker News commenter, on the GPT-5.6 launch thread
Lunaではキャッシュ書き込みの追加料金にも注意したい。キャッシュ書き込みは非キャッシュ入力料金の1.25倍で課金される(OpenAI model page)。また、入力が272Kトークンを超えるプロンプトでは、リクエスト全体に対して入力が2倍、出力が1.5倍の料金になる。エージェントのコンテキストが272Kトークンを恒常的に超えるなら、V4 Proのキャッシュ優位が最も強くなる場面で、Lunaの実効料金はおおむね倍になる。
コスト試算の前に公式ドキュメントで料金を確認する
この比較を調べるなかで、第三者サイトにはV4 Proの入力料金を100万トークンあたり$0.435から$1.74まで幅広く掲載した例があり、Lunaのコンテキストウィンドウも400Kから1.05Mまでばらついていた。確認にかかる時間は1分もない。料金は上記の公式2ページだけで確認すること、モデルバージョン文字列を確認すること(現在のAPIはDeepSeek-V4-Proを提供しており、Flashは-0731に固定されている)、そして引用されている「入力料金」がキャッシュヒット時かミス時かを確認すること。この最後の点は重要で、V4 Proでは両者に120倍の差がある。
用途の向き不向きを決める仕様差
価格以外では、最大出力、モダリティ、オープン性、APIの提供範囲という4つの仕様差が用途を分ける。両モデルともおよそ100万トークンのコンテキストウィンドウを掲げているため、コンテキスト長だけでは選別できない(Lunaは1,050,000トークン、V4 Proは1M)。
| 仕様(2026年8月10日確認) | GPT-5.6 Luna | DeepSeek V4 Pro |
|---|---|---|
| コンテキストウィンドウ | 1,050,000 | 1M |
| 最大出力トークン数 | 128K | 384K |
| 入力モダリティ | テキスト+画像 | テキストのみ |
| 推論の制御 | Effortレベル(low→max) | Thinkingオン(デフォルト)/オフ |
| オープンウェイト | いいえ | はい(セルフホスト可能) |
| Responses API | はい | 未対応(公式情報:2026年8月上旬) |
| 同時実行数の上限 | 利用ティアに応じる | 500 |
| 知識カットオフ | 2026年2月16日 | 料金ページには記載なし |
V4 Proの最大出力は384Kトークンで、Lunaの128Kの3倍だ。チャンク分割が失敗要因になりやすい、単発でのコードベース生成、長文翻訳、大規模な構造化抽出では重要になる。一方、Lunaの画像入力は別の理由で価値がある。DeepSeekの利用者も、指示されずともこの点を挙げている。
My only real complaint is that they can't do images, which limits their ability to autonomously debug some kinds of issues. — Hacker News commenter, on running DeepSeek for hobby projects
オープンウェイトという点ではV4 Proが逆に有利だ。ダウンロードしてセルフホストできるため、データレジデンシー要件がある場合、この比較ではV4 Proだけが選択肢になる。ただし、この規模のモデルを提供するには本格的なマルチGPUハードウェアが必要で、週末に手軽に構築できるものではない。
ベンチマークはモデル差よりEffortモードの影響が大きい
GPT-5.6 LunaとDeepSeek V4 Proの公開スコアは、各モデルをどのEffortモードで測ったかによって勝者が入れ替わる。たとえば、Lunaをlow effort、V4 Proをmaxで動かしたあるトラッカーでは33.3対44.3でV4 Proが勝つ。一方、両方をmaxで実行するArtificial Analysisでは52対45でLunaが勝つ。どちらかが誤りなのではなく、測っている構成が違う。
レイテンシの数字にも同じ落とし穴がある。Artificial Analysisは、Lunaのmax effort時における最初の回答トークンまでの時間を132秒と報告している。max effortでは、Lunaは回答前におよそ2分考えることになる。デフォルト設定で行った今回のテストでは、Lunaは3〜10.7秒で応答した。どちらも実測値だが、本番構成に近いのは片方だけだ。出力を始めてからのスループットはLunaが明確に優位で、202トークン/秒に対して78トークン/秒となっている(Artificial Analysis)。
Effortモードは同一モデルのスコアも大きく動かす。V4 ProはGPQA Diamondでmax thinking時に90.1%を記録するが、thinkingをオフにすると72.9%だ。両モデルをmax effortで比べたベンチマークでは、SWE-Bench ProはLunaが62.7%対55.4%でリードし、BrowseCompは83.3対83.4でほぼ同点となる。スコアカードを信頼する前に、3点を確認したい。どのEffortモードか、レイテンシにthinking時間が含まれるか、そしてベンチマークのバージョンは同一かだ。あるトラッカーにおけるTerminal-Benchの84.7対67.9という差は、v2.1とv2.0を比較している。
結局、どちらを使うべきか
ユーザー向けプロダクトならGPT-5.6 Lunaを選びたい。今回のデフォルト設定テストでは3タスクすべてで2〜3倍高速で、非キャッシュ入力の価格はV4 Proの半額、画像入力にも対応する。キャッシュを多用するエージェントループ、128Kトークンを超える出力、自社ハードウェアでの実行が必要な用途ならDeepSeek V4 Proが向く。ただし、長期契約を考えるなら、公式の値上げ予告をコストに織り込むべきだ。GPT-5.6 LunaとDeepSeek V4 Proはエンドポイントを切り替えるだけで試せるため、導入前に自分のワークロードで今回の3プロンプトを再実行してみるとよい。
| ワークロード | 選択 | 決め手 |
|---|---|---|
| チャットボット、ユーザー向けアプリ | Luna | 今回のテストで3.0〜10.7秒、V4 Proは7.6〜27.2秒。202対78トークン/秒 |
| 新規入力を大量処理する用途 | Luna | 非キャッシュ入力100万トークンあたり$0.20対$0.435 |
| 固定コンテキストを繰り返すエージェントループ | V4 Pro | キャッシュ入力100万トークンあたり$0.003625対$0.02 |
| 単発での長大な出力 | V4 Pro | 最大出力384K対128K |
| 画像対応(スクリーンショット、画像化したPDF) | Luna | V4 Proはテキスト専用 |
| セルフホスティング/データレジデンシー | V4 Pro | オープンウェイト。LunaはAPI専用 |
| 2027年までの予算確実性 | Luna | DeepSeekが公式に値上げを告知 |
FAQ
GPT-5.6 LunaとDeepSeek V4 Proはどちらが安い?
一概には言えない。非キャッシュ入力はLunaが54%安く、100万トークンあたり$0.20対$0.435。キャッシュ入力はV4 Proが5.5倍安く、$0.003625対$0.02で、出力もV4 Proが27%安い($0.87対$1.20)。キャッシュを多用するエージェントはV4 Pro、新規入力中心のワークロードはLunaのほうが低コストになる。
両モデルとも100万トークンのコンテキストウィンドウに対応している?
対応している。Lunaは1,050,000トークン、V4 Proは1Mトークンだ。ただしLunaは、入力が272Kトークンを超えるリクエストでは、リクエスト全体に入力2倍・出力1.5倍の料金が適用される。
DeepSeek V4 Proはオープンソースで、セルフホストできる?
できる。V4 Proはオープンウェイトとして提供され、API専用のLunaと異なりセルフホスト可能だ。ただし、単一ワークステーションではなく、マルチGPUのサービング用ハードウェアを前提に考えたい。
GPT-5.6 Lunaは画像入力に対応している?
対応している。Lunaはテキストと画像を入力できる。DeepSeek V4 Proはテキスト専用で、同モデルの利用者は自律デバッグのワークフローにおける主な制約として画像対応の欠如を挙げている。
各モデルの最大出力トークン数は?
DeepSeek V4 Proは1レスポンスあたり最大384Kトークン、GPT-5.6 Lunaは最大128Kトークンを出力できる。長い文書や大規模なコードファイルを単発生成する用途では、V4 Proの上限は3倍高い。
関連記事
- DeepSeek V4 Pro vs GPT-5.6 Sol:同じDeepSeekのフラッグシップをOpenAIのミドルティアと比較
- GPT-5.6 Luna review:この比較だけでは見えないLuna単体の実力
- DeepSeek V4 Flash vs V4 Pro:V4 Proの価格リスクを受けて下位モデルを検討するなら