AIREITER

GPT-5.6 Luna vs GPT-5.4 mini:今より安いのはどっち?

最終更新日: 2026-07-31 03:30:07

2026年7月30日、OpenAIはGPT-5.6 LunaのAPI料金を約80%引き下げた。発売時の$1/$6から、現在は100万トークンあたり入力$0.20/出力$1.20だ。この価格なら、GPT-5.4 mini($0.75/$4.50)より約73%安い。それでいて、今回試したコーディングと推論のプロンプトでは、回答の正しさに差は見られなかった。miniが明確に勝るのは速度で、応答はおよそ2倍速い。レイテンシが最優先の用途だけは、旧世代の小型モデルを選ぶ理由が残る。

7月30日の値下げで前提が変わった

GPT-5.6 Lunaは2026年7月9日、100万トークンあたり$1/$6で一般提供を開始した。GPT-5.6 familyにおけるコスト効率重視のモデルとして位置付けられていたが、OpenAIの低価格モデルgpt-5.4-mini($0.75/$4.50)よりは高価だった。ところが約3週間後の7月30日、OpenAIはLunaを約80%値下げして$0.20/$1.20に改定。同時にGPT-5.6 Terraも約20%引き下げ、$2/$12となった。Lunaは現在、gpt-5.4-nano($0.20/$1.25)と同じ価格帯にいる。nano級の価格で、現行世代のモデルを使えるという位置付けだ。

Lunaを$1/$6と紹介する情報を見かけても、その発売時価格は2026年7月30日に終了している。2026年7月31日に確認したStandard tierの現行料金は$0.20/$1.20だ。

入力1000万トークンと出力100万トークンのワークロードにおけるLuna、mini、nanoのコスト逆転

定価で比べるLunaとmini

現行のStandard tier料金では、入力・出力ともにLunaのほうがminiより安い。短いプロンプトでも長いプロンプトでも、この差は変わらない。コンテキストウィンドウも、miniの400Kに対してLunaは1,050Kだ。

モデル(Standard、100万トークンあたり)入力キャッシュ済み入力出力コンテキスト
gpt-5.6-luna(短コンテキスト)$0.20$0.02$1.201,050K
gpt-5.6-luna(長コンテキスト、>200K)$0.40$0.04$1.801,050K
gpt-5.4-mini$0.75$0.075$4.50400K

出典:developers.openai.com/api/docs/pricing。2026-07-31確認。参考までに、gpt-5.4-nanoの料金は$0.20/$1.25で、Lunaは現在この価格帯に並んでいる。

入力1000万トークン、出力100万トークンという中程度のワークロードで計算すると、Lunaは$3.20、miniは$12.00となる(nanoは$3.25)。入力・出力ともに100万トークンなら、Lunaは$1.40、miniは$5.25だ。Lunaは入力が200Kトークンを超えると料金が2倍になり、長コンテキスト料金は$0.40/$1.80になる。それでも、miniの一律$0.75/$4.50より安い。miniには長コンテキスト用の料金帯がなく、400Kのウィンドウ全体が短コンテキスト料金の対象だ。ファミリー全体の料金を詳しく見るなら、GPT-5.6 pricing guideを参照してほしい。

gpt-5.6-lunaの入力$0.20、出力$1.20が表示されたOpenAI開発者向け料金ページ、2026-07-31確認

同一プロンプトで比較:品質、トークン数、速度

同じAPIエンドポイントから、両モデルへ同一のプロンプトを送った。内容は、最長の有効な括弧部分文字列の長さを返すコーディング課題と、井戸の中のカタツムリ問題を3回実行する推論課題だ。どちらも両方の課題を正しく解き、括弧問題では同じスタックベースのアルゴリズムを提示。カタツムリ問題も3回すべて「28日」と答えた。違いが出たのは正確性ではなく、応答速度と出力の詳しさだった。

回答品質と正確性

コーディング課題では、Lunaとminiはいずれも番兵となる基準インデックスを使った、機能的に同等のO(n)スタック解法を出した。誤りはなかった。推論課題でも、両者は正しく28日と結論づけ、カタツムリは28日目に滑り落ちる前に井戸から脱出する点も押さえていた。この2つの基本課題に限れば、実質的には引き分けといえる。より難しい推論問題でのストレステストは実施していない。

速度とレイテンシ

エンドツーエンドの速度はminiがおよそ2倍速かった。推論課題の3回の実行では、miniの平均は約2.8秒、Lunaは約5.5秒。コーディング課題の単発実行では、miniが4.0秒、Lunaが4.6秒だった。Lunaの応答が遅いのは、より詳しく出力する傾向とも一致する。推論課題の出力はLunaが168トークン、miniは76トークンだった。即答よりも、回答の網羅性を優先するモデルといえる。

「medium thinkingを使えば基本的に5.4 miniと同じくらい速く、推論は非常に優秀で、5.4以上のレベルだ。」— r/codex、「GPT-5.6 Luna is really underrated」スレッド

デフォルト設定では、miniのほうが速く応答を返す。

タスク単位のコスト

Lunaは出力が多めでも、単価の低さがそれを上回る。推論プロンプトではLunaの平均出力が168トークン、miniは76トークンだったが、現行料金での回答コストはLunaが約$0.001、miniが約$0.004だった。これは2026-07-31にAIReiter API経由でgpt-5.6-lunaとgpt-5.4-miniへ送信した、少数サンプルかつ1セント未満の数値だ。デフォルトeffort、米国エンドポイントを使い、時間はレスポンス全体の実測時間、トークン数はAPI報告のcompletion tokensである。ベンチマークではなく傾向として扱うべきだが、方向性は明確だ。正答1件あたりのコストはLunaのほうが安い。

「どちらが賢いか」の議論は、設定差を見落としがち

スコアカード上の数値では、Lunaはコーディングと推論でminiを上回る。SWE-Bench Proは62.7対54.4、GPQA Diamondは92.3対88.0、Toolathlonは53.4対42.9だ(OpenAIのモデルスコアカードによる)。一方、結論が逆転するものとしてよく引用されるのが、Artificial AnalysisのIntelligence Indexだ。ここではGPT-5.4が51、Lunaが46となっている。ただしこの比較では、Lunaをhigh effort、GPT-5.4をxhigh effortで動かしている。両者の推論予算が異なり、同一条件の比較ではない。

ベンチマークGPT-5.6 LunaGPT-5.4 mini所見
SWE-Bench Pro62.754.4Lunaが上
GPQA Diamond92.388.0Lunaが上
MMMU Pro78.476.6僅差
Toolathlon53.442.9Lunaが上
Terminal-Bench84.7 (v2.1)60.0 (v2.0)バージョンが異なる
OSWorld45.6 (v2.0)72.1 (Verified)プロトコルが異なる

スコアはOpenAI公開のモデルスコアカードをもとに集計し、docsbot.aiでも照合した。

読む際には2つ注意したい。第一にeffort tierだ。miniにはNone/Low/Medium/High/XHighという細かな設定がある一方、Lunaはhigh推論tierがデフォルトになる。miniをxhighまで上げ、デフォルトのLunaと比較すれば、miniの見かけ上のスコアは押し上げられる。第二に、表の各行も厳密な同条件比較ではない。docsbot.aiは、Terminal-BenchとOSWorldの数値にベンチマークのバージョンやプロトコルの違いが混在していると指摘している。そのため、miniのOSWorld 72.1がLunaの45.6を上回って見えても、実際には微妙に異なる対象を試している。

スコア以外では、Lunaの知識カットオフは2026年2月で、miniの2025年8月より新しい。コンテキストウィンドウもLunaは1.05M、miniは400Kだ。

「Lunaは96%高い」という話は、すでに古い

広く共有されたOpenAI community testでは、6ターンの会話あたりLunaはminiより96%高コストという結果が出た。この数値自体は正しいが、値下げ前の測定結果だ。テストは7月11日、Lunaが発売時料金の$1/$6だった時点で行われている。また差の大半はモデルそのものではなく、テストアプリのキャッシュ無効化バグによるものだった。毎ターン、最上位のinstructionsを書き換えるのをやめると、Lunaの割高幅は16.7%まで低下。さらにLunaは9.9%高速で、ブラインド評価の品質スコアも高かった(4.80対4.28)。

現行の$0.20/$1.20なら、キャッシュを考慮しなくてもLunaのほうがminiより安い。キャッシュはもはやLunaとminiの選定を左右する論点ではないが、コスト最適化の仕組みとしては理解しておく価値がある。OpenAIはキャッシュ書き込みを入力料金の1.25倍で課金する。現在のLunaなら$0.25/Mだ。キャッシュ読み取りには90%の割引が適用され、キャッシュ寿命は最低30分となる。アプリが毎ターンシステムプロンプトを書き換えると、キャッシュのプレフィックスが無効化され、読み取り料金ではなく書き込み料金を払うことになる。96%という数字を生んだのはこの罠だった。

結局、どちらを呼び出すべきか

大半のワークロードでは、いま選ぶべきはLunaだ。両方のコンテキスト料金帯で安く、品質は同等以上。知識カットオフも新しく、ウィンドウは2.6倍大きい。レイテンシが絶対条件の場合、あるいはLunaにはないeffortの細かな調整が必要な場合にminiを選ぶとよい。

求めるもの選択理由
正答あたりの最安コストLuna$0.20/$1.20で、miniより約73%安い
最小レイテンシminiエンドツーエンドで約2倍高速(推論で約2.8秒対約5.5秒)
None/XHighの細かなeffort制御miniLunaはhigh tierのみ
400Kトークン超のプロンプトLuna1.05Mウィンドウ。miniは400Kが上限
最も簡潔な出力mini同じタスクで出力トークン数は約半分

実用的なルーティングなら、レイテンシ優位が効く場面ではminiをデフォルトにし、品質とウィンドウサイズが重要な場面ではLunaをエスカレーション先や長コンテキスト用にする。両モデルは統一APIからgpt-5.6-luna、gpt-5.4-miniとして呼び出せる。たとえばAIReiter GPT-5.6 Luna endpointがある。ルーティングではもう一点注意したい。フラッグシップのSolは$5/$30で、Lunaの約25倍だ。エンドポイントで素のgpt-5.6 IDがSolにエイリアスされるなら、必ず完全なgpt-5.6-luna IDを指定しよう。

よくある質問

GPT-5.6 LunaはGPT-5.4 miniより安い?

はい。現行料金では約73%安い。2026年7月30日の値下げ後、Lunaは100万トークンあたり入力$0.20/出力$1.20で、miniの$0.75/$4.50を入力・出力ともに下回る。

GPT-5.6 Lunaは5.4 miniより速い? 遅い?

遅い。今回の同一プロンプトテストではおよそ2倍の差があり、推論ではminiの平均約2.8秒に対してLunaは約5.5秒だった。Lunaは速度と引き換えに、より完全な推論を行う。effortを下げれば差は縮まる。

GPT-5.6 Lunaはmini tierを置き換える?

いいえ。LunaはGPT-5.6世代におけるコスト効率重視のtierであり、gpt-5.4-miniは現在も販売・サポートされている別の旧世代小型モデルだ。

GPT-5.4 nanoとLunaでは、どちらが安い?

実質的には同等だ。Lunaは$0.20/$1.20、nanoは$0.20/$1.25。Lunaは出力料金がわずかに安く、1世代新しく、知識カットオフもより新しい。

Lunaとminiはいつリリースされた?

Lunaは2026年7月9日に発売され、2026年7月30日に現行価格へ値下げされた。GPT-5.4 miniの発売日は2026年3月17日だ。

出典