Qwen3.8-MaxのAPI料金は、100万トークンあたり入力2ドル、出力6ドルだ。出力単価だけを見ると、Claude Opus 4.8、Claude Fable 5、GPT-5.6 Solの4分の1以下に収まる。一方で、reasoning_effortの初期値はxhigh。最初のリクエストから、表示上の単価と実際の請求額には差が出やすい。
Qwen3.8-Maxのトークン料金
Qwen3.8-Maxは、総パラメータ数2.4兆のMixture-of-Expertsモデルだ。トークンごとに有効になるパラメータ数は950億で、AlibabaのフラッグシップはQwen3.7-Maxから本モデルへ移行する。以下は、更新日が「Updated: Aug 2, 2026」と記載されたAlibabaのモデルページに掲載されている料金である。
| 項目 | 100万トークンあたりの料金 |
|---|---|
| 入力 | $2.00 |
| 出力 | $6.00 |
| 入力(暗黙キャッシュ) | $0.25 |
| 明示的キャッシュの作成 | $2.50 |
| 明示的キャッシュの読み取り | $0.17 |
暗黙キャッシュはコードの変更なしで使える。同じプレフィックスが繰り返される場合、自動的に100万トークンあたり0.25ドルで課金され、通常の入力料金の8分の1になる。判断が必要なのは明示的キャッシュだ。書き込みは2.50ドル、読み取りは0.17ドルなので、キャッシュなしの入力よりは2回目の読み取りから安くなる。ただし、0.25ドルの暗黙キャッシュを下回るのは、同一プレフィックスをおよそ30回読み取ってからだ。大半のアプリケーションでは、明示的キャッシュには手を出さないほうがよい。
ただし、APIがオープンでも重みはまだ公開されていない。Alibabaのローンチ記事では、Qwen3.8-Maxの重みを翌週にHugging FaceとModelScopeで公開するとしている。数週間にわたる日付なしの「coming soon」表記の後、初めてカレンダー上の予定が示された形だ。8月3日時点でモデルページのサイドバーには、依然としてOpen Source: Noとある。
出力6ドルだけでは実コストを見誤る理由
Alibabaのローンチドキュメントでは、reasoning_effortに3段階の設定があり、デフォルトは最も深い推論モードであるxhighとなっている。mediumは「精度と速度のバランス」、lowは「速度とコストを最適化」する設定だ。また、すべてのシナリオでpreserve_thinkingもデフォルトで有効になっている。thinkingトークンは出力トークンとして課金されるため、プロンプトを書いた時点で、これら2つのデフォルト設定は支出を6ドルの出力単価へと寄せる。
つまり、実効コストを左右する2つのレバーは初期状態ではコスト増の方向に設定されている。どちらもリクエストパラメータ1つで変えられる。深い検討が不要なタスクまで100万トークンあたり6ドルを払うのか、それとも必要な場面だけに絞るのかは、mediumまたはlowへ下げるだけで変わる。
初期テスターの一人は、その深い推論がもたらすものについて、r/LocalLLaMAのスレッドタイトルで率直にこう評している。
Qwen 3.8 max first impressions - model is moderate and it is awful on thinking
これはベンチマーク結果ではない。デフォルト設定を標準化する前に、自分のワークロードで各推論レベルを試すべきだという材料として受け取るのが妥当だ。
長文コンテキストでも追加料金なし。その効きどころ
Qwen3.8-Maxのモデルページには入力料金と出力料金がそれぞれ1つだけで、コンテキスト長による料金区分はない。対してGemini 3.1 ProとGPT-5.6 Solは、一定のコンテキスト長を超えると単価が上がる。
| モデル | 入力(短いコンテキスト) | 出力(短いコンテキスト) | 入力(長いコンテキスト) | 出力(長いコンテキスト) |
|---|---|---|---|---|
| Qwen3.8-Max | $2.00 | $6.00 | $2.00(最大1M) | $6.00(最大1M) |
| Gemini 3.1 Pro | $2.00(≤200K) | $12.00 | $4.00(>200K) | $18.00 |
| GPT-5.6 Sol | $5.00 | $30.00 | $10.00 | $45.00 |
Gemini 3.1 Proは、200KトークンまではQwen3.8-Maxと入力単価が同額だが、超えると2倍になる。GPT-5.6 Solは、すでに再編された料金表の上で、長文コンテキスト帯に入ると入力料金が2倍、出力料金も1.5倍になる。
そのため、コンテキストが長くなるほど価格差は広がる。400Kトークンのプロンプトでは、Qwen3.8-Maxの入力コストは0.80ドル、Gemini 3.1 Proは1.60ドル、GPT-5.6 Solは4.00ドルだ。文書処理パイプライン、長時間のエージェントセッション、リポジトリ全体を対象にした処理では、この差が積み上がる。短いチャットの往復では、ほとんど気にならない。
Alibabaが比較対象にしたモデルとのコスト差
出力100万トークンあたり6ドルは、Claude Opus 4.8の25ドルの4分の1未満であり、GPT-5.6 Solの30ドルの5分の1でもある。50ドルのClaude Fable 5は8倍を超える。もちろん、この差を受け入れられるかは性能次第だ。Alibabaは、その価値があると示すため、28行のベンチマーク表を公開している。
PaperBenchでは93.0で首位となり、GPT-5.6 Solの90.5、Fable 5の88.8を上回る。JobBenchでも53.4を記録し、Opus 4.8の48.4を超えた。Terminal Bench 2.1では86.6で、両Claudeモデルをわずかに上回っている。一方、SWE-bench Proでは大きく劣る。Fable 5の80.0に対して67.7で、12ポイント以上の差がある。これらの数値はいずれもベンダー自身が同じページで実施・公開したものだ。
判断軸は明確に分かれる。長いツール呼び出しループ、文書生成、PaperBenchが測る研究再現型のように出力が多いエージェント作業では、出力料金が4〜8分の1になることが、そもそも運用可能かどうかのユニットエコノミクスを変える。一方、SWE-bench Proが探るようなリポジトリ規模のソフトウェアエンジニアリングでは、割引の代わりに明確な性能低下を受け入れることになる。こうした領域では、Fable 5の料金を払う意味がなおある。
自分のワークロードで試す準備は難しくない。Alibabaのローンチ記事には、OpenAI互換のchat-completionsおよびresponses呼び出し、さらにAnthropic互換インターフェースが記載されている。これはClaude Opus 4.8とGPT-5.6 Solが受け付ける2種類のリクエスト形式と同じだ。
今すぐコードで見直すポイント
モデルIDはqwen3.8-max。8月3日時点でAlibabaのモデルカタログにある3.8系はこれだけで、プレビュー用のqwen3.8-max-previewは消えている。GA後もプレビュー料金が残っていると考える前に、利用中のリレープロバイダーを確認したい。
どちらのインターフェースも、北京、シンガポール、米国バージニアの3つのリージョナルベースURLから利用できる。先にぶつかりやすい上限は以下の通りだ。
| 上限 | 値 |
|---|---|
| コンテキストウィンドウ | 1M |
| 最大入力 | 991.80K |
| 最大入力(thinkingあり) | 983.61K |
| 最大出力 | 131.07K |
| 1分あたりのリクエスト数 | 15K |
| 1分あたりのトークン数 | 2M |
2つの入力上限には約8Kトークンの差がある。thinkingを有効にすると、出力トークンだけでなく入力側の余裕も減るということだ。そして翌週に重みが実際に公開されたなら、セルフホスティングと2ドル/6ドルのAPI料金を比較する際は、950億のアクティブパラメータ数が出発点になる。
FAQ
Qwen APIは無料ですか?
いいえ。Qwen3.8-Maxは100万トークンあたり入力2ドル、出力6ドルの従量課金だ。AlibabaのAPIプラットフォームで販売されているToken Planサブスクリプションは、トークン単価のAPI課金とは別の、クレジットベース製品である。
Qwen Maxの料金はいくらですか?
現行世代では、100万入力トークンあたり2ドル、100万出力トークンあたり6ドル。暗黙的なプレフィックスキャッシュは0.25ドルだ。Alibaba Cloudのドキュメントにある古いqwen-maxは前世代を指しており、料金も異なる。
Qwen3.8-Maxは1Mコンテキストウィンドウで追加料金がかかりますか?
かからない。入力・出力とも、5Kトークンでも900Kトークンでも同じ料金だ。この点が、GPT-5.6 SolおよびGemini 3.1 Proとの最も明確な料金構造上の違いである。
Qwen3.8-MaxはQwen3.7-Maxより安いですか?
公式ページだけでは答えられない。Qwen3.7-Maxのモデルページでは、50%オフの表示がある一方、トークン単価は--と表示されており、比較できる公表価格がない。
関連記事
- Claude Fable 5の料金:比較対象となる入力10ドル/出力50ドルの料金帯
- Claude Fable 5のトークンコストを抑える方法:別ベンダーにおける同様の推論設定・キャッシュのレバー