AIREITER

Qwen 3.8 vs Kimi K3(2026年):単体GPUで動かせるのはどちらか

最終更新日: 2026-08-18 07:38:33

2026年8月、Qwen 3.8とKimi K3の比較は単純な性能勝負ではなくなった。両ファミリーとも重みをダウンロードでき、最上位モデルも一般提供されているが、選ぶべきモデルは導入形態で変わる。検証済みのエージェント型コーディング性能ではKimi K3が最有力、トークン単価ではQwen 3.8 Maxが有利。そしてApache-2.0のQwen3.8-27Bなら、コンシューマー向けGPU 1枚で動かせる。もっとも、Kimiの「オープン」なフラッグシップは報告ベースで1.56 TBのチェックポイントだ。重みが公開されていることと、現実的にセルフホストできることは別の話である。

Qwen 3.8とKimi K3は何をリリースしたのか

Kimi K3(Moonshot AI)は、2026年7月16日に単一のフラッグシップモデルとして登場した。総パラメータ数は2.8兆、トークンあたりのアクティブパラメータは104BのMoEで、Kimi Delta AttentionとGated MLAを採用。コンテキスト長は1,048,576トークンで、ネイティブのビジョン入力にも対応する。7月27日には重みと技術レポートが、独自のKimi K3 Licenseで公開された。Emergentの比較記事にまとめられた規約によれば、大規模な商用再販事業者や月間ユーザー数が1億人を超える製品には条件が付く。

Alibabaが対抗して投入したのは、単体モデルではなくファミリーだった。Qwen 3.8 Maxは7月19日にプレビュー公開され、8月3日にQwenCloudで一般提供を開始。総パラメータ数は2.4T、アクティブパラメータは約95Bである。8月12日ごろには、Qwen/Qwen3.8-2.4T-A95BとしてHugging Face上に重みが現れ、独自のqwen3.8-maxライセンスが適用された。数日後にはQwen/Qwen3.8-27Bも公開された。こちらはApache-2.0の高密度27Bビジョン言語モデルで、ネイティブでは262K、YaRNを使えば1Mまでコンテキストを拡張できる(Yotta Labsは8月13~14日付としている)。

Kimi K3Qwen 3.8 MaxQwen3.8-27B
総パラメータ数 / アクティブパラメータ2.8T / 104B2.4T / 約95B27B高密度
コンテキスト長1,048,5761M(最大入力991.8K)ネイティブ262K、YaRNで1M
ライセンスKimi K3 License(独自)独自のqwen3.8-maxライセンスApache-2.0
重み公開時期2026年7月27日2026年8月12日ごろ2026年8月13~14日ごろ
ビジョン入力テキスト+画像(正式対応)API経由でテキスト、画像、動画テキスト、画像、動画

なおMoonshotは、K3の公開から48時間以内に、需要がGPU容量を上回ったため新規コンシューマー向けサブスクリプションを一時停止したと報じられている。製品を単一プロバイダーに賭ける前に、覚えておきたい点だ。

ベンチマークは「誰が測ったか」で分けて見る

両社とも大きなベンチマーク表を出しているが、そこでは複数のハーネスが混在している。Kimiのモデルカード自身も、競合モデルのスコアには異なるエージェントハーネスが使われ、一部の行はH100ではなくH20ハードウェアで測定されたと明記している。以下の共通項目は、監査済みの数値ではなくベンダー公表値として扱うべきだ。

ベンダー公表の共通ベンチマークスコア:Qwen 3.8 MaxとKimi K3

共通項目を見る限り、エージェント型コーディングではKimi K3が先行する。モデルカードによると、FrontierSWEは81.2対73.5、Terminal-Bench 2.1は88.3対86.6でK3が上回った(Qwen側の出典は2.4Tモデルのカード)。Qwenのローンチ資料ではOSWorld-Verifiedが86.1で、K3のカードにある84.8を上回る。またQwenのカードには、PaperBench 93.0、IFBench 82.8、SWE-bench Pro 67.7という単独項目での強い数値が載る。一方、Qwenが報告していない行では、K3がSWE-Marathon 42.0、BrowseComp 91.2、MCPMark-Verified 94.5を記録している。

独立評価の記録は、現時点ではK3に大きく偏っている。Emergentの追跡情報では、Kimi K3はローンチ時のArtificial Analysis Intelligence Indexが57、現行バージョンの指数では60で、Claude Fable 5とGPT-5.6 Solに次ぐ順位とされる。さらにOrcarouterの比較では、Frontend Code Arenaで1,679 Eloの1位を獲得したとされている。Qwen 3.8 Maxはローンチ時に独立したインデックスへ掲載されておらず、cheapestinference.comのトラッカーはArtificial Analysisの指数として53を報告した。56へ更新されたとするコミュニティ投稿もあるが、未検証だ。

同一タスクでの直接対決は、TrilogyAIのStackPerfアーキテクチャ分析のみである(Orcarouterが記録)。プレビューエンドポイントでの評価は、K3が83/100、Qwenが80/100だった。Qwenはリポジトリ引用数で354件対Kimiの274件、ゲートウェイリクエスト数で22回対Kimiの53回、ツール呼び出し失敗はゼロ対Kimiの2回を記録している。

共通表には出てこない数字も重要だ。Qwen自身のカードでは、27BのOSWorld-Verifiedは84.3で、K3の84.8との差は0.5ポイント以内に収まる。高密度27Bモデルが、コンピューター操作では2.8Tのフラッグシップにここまで迫る。ただしコーディング性能はK3のクラスではない。Terminal-Benchは73.0対88.3だ。それでもLiveCodeBench v6の90.3、SWE-bench Proの61.7は、実務で使える主力モデルと呼ぶに十分な値である。r/AISEOInsiderの実使用比較スレッドもデータと同じ傾向だった。単発のビルドではQwenの勝ちが多く、コンテキストが長くなり、修正の往復が深くなるとKimiが前に出る。

API料金:出力100万トークン15ドルと推論コスト

定価だけ見ても方向性は明確だが、実際の支出では差がさらに広がる。両モデルともデフォルトで推論を行い、K3はreasoning_effort: max、Qwenはxhighを使う。そして推論トークンも出力として課金されるからだ。

Qwen 3.8 MaxとKimi K3のAPI定価
100万トークンあたりQwen 3.8 Max(QwenCloud)Kimi K3(Moonshot)
入力(キャッシュミス)$2.00$3.00
入力(キャッシュヒット)$0.25$0.30
出力(推論を含む)$6.00$15.00
明示的キャッシュの作成 / 読み出し$2.50 / $0.17—
Qwen3.8-MaxのQwenCloud料金ページ

2026年8月時点の定価で、2つのセッションを試算すると次のようになる。

セッションQwen 3.8 MaxKimi K3差
エージェント型コーディング:入力500K(うち60%キャッシュ)、出力40K$0.72$1.291.8倍
新規コンテキストの文書パイプライン:入力2M、出力100K$4.60$7.501.6倍

この計算からルーティングの基準も見えてくる。自分のワークロードにおけるK3の受け入れ率が、Qwenよりおよそ1.8倍のトークンコスト差を上回る場合にだけ、K3へ送る価値がある。Moonshot自身も低予算向けの選択肢を用意しており、Kimi K2.7 Codeは256Kコンテキストで入力$0.95、出力$4.00だ。Kimiファミリーで最安のコーディング経路はK3ではない。現在K3をルーティングするなら、このAPIエンドポイントにMoonshot公表レートで掲載がある。両者のより詳細な料金体系は、Qwen3.8-Maxの料金分析とKimi K3の料金ガイドで確認できる。

セルフホスト:1.56 TBか、RTX 4090 1枚か

オープンウェイトという点では共通していても、セルフホストの現実はおよそ2桁違う。

ダウンロード可能な重みの容量:Kimi K3とQwen3.8-27Bのコミュニティ量子化版

K3は量子化対応のMXFP4重みを提供している(モデルカード)。しかし、1.56 TBと報告されるチェックポイントはクラスタ向けの案件だ。同じ情報源では、64基以上のアクセラレータにまたがるvLLMを推奨している。トークンを1つ配信する前から、レンタル可能とはいえ実在するコスト項目になる。加えて、ライセンスの大規模利用条件も適用される。

27Bは対照的だ。コミュニティ製GGUFはおよそ8.5 GBから28.9 GBまであり、Unslothのdynamic GGUFおよびNVFP4ビルドなら最小で約17 GBに収まる。サーバー展開向けの公式FP8版も用意されている。つまり、すでに手元にあるようなハードウェアで動かせる。

「SINGLE RTX 4090で160KコンテキストのQwen3.8-27B。フルGPUオフロードで47~57 tok/s」— r/Qwen_AIのデプロイ投稿

Maxの重みは両者の中間に位置する。Qwen3.8-2.4T-A95BとそのFP8版は、独自のqwen3.8-maxライセンスでダウンロード可能だ。ただし公開アーティファクトはテキスト専用で、思考モードは無効化できない。ビジョン入力、非思考モード、デフォルト1Mコンテキストは、チェックポイントではなくQwenCloud APIレイヤーの機能である。27Bで各量子化方式ごとに何ができ、何ができないかは、Qwen3.8-27BフィールドガイドにランタイムとVRAM表がある。K3の重み公開については、Kimi K3オープンウェイト解説で詳しく扱っている。

エージェント実装で効いてくる統合上の注意点

モデルカードに書かれた3つの挙動を見落とすと、本番で丸1日デバッグすることになりかねない。

モデル挙動 / 制限実装への影響
Kimi K3思考は常時有効。マルチターンおよびツール利用クライアントは、reasoning_contentとtool_callsを含む過去のassistantメッセージ全体を再送する必要がある(カード)推論トレースを落とすとエージェントループが劣化する。保持すると、ループが長くなるほど支出が増える
Qwen3.8-27Bpreserve_thinkingはデフォルトで有効。reasoning_effortはmedium/lowまで下げられる。262Kを超えるYaRNは静的スケーリング(カード)リクエスト単位で無効化できる。カードでは、低い推論強度にしてもリトライで節約分が消え、エンドツーエンド時間が必ずしも短縮されないと警告している。YaRNは長いジョブでのみ有効にしたい
Qwen 3.8 MaxとK3の上限Max:入力991.8K / 出力131.07K(QwenCloud)。K3:入力1,048,576 / デフォルト出力131K、1Mへ近づく構成もあるどちらも「1Mコンテキスト」が1Mの実用的な出力を保証するわけではない。サードパーティーのニードルテストは248Kで18/18の事実を検出したが、それを超える範囲はテストしていない

FAQ

コーディングではQwen 3.8の方がKimi K3より優れている?

現時点で得られる証拠では、そうは言えない。Kimi K3は重要なエージェント型コーディング項目で先行している。FrontierSWEは81.2対73.5、Terminal-Bench 2.1は88.3対86.6であり、独立インデックスのスコアも確認されているのはK3だけだ。Qwen 3.8 Maxはターミナル作業で近い性能を示し、トークン単価と上記試算のセッションコストでは安い。27Bはそもそもまったく別の重みクラスである。

Qwen 3.8とKimi K3では、どちらが安い?

定価の全項目でQwen 3.8 Maxだ。入力は$2対$3、出力は$6対$15。両モデルともデフォルトで有効な推論を出力として課金するため、タスクが難しくなるほどKimiの不利は広がる。上の計算では、キャッシュを使うエージェントセッションでおよそ1.8倍となった。

セルフホストは可能? ライセンスはどうなっている?

可能だ。3つのチェックポイントはいずれもダウンロードできる。Qwen3.8-27BはApache-2.0で、量子化すれば単体の24 GB GPUに収まる。Kimi K3は約1.56 TBのMXFP4チェックポイントのためクラスタ規模のハードウェアを必要とし、独自のKimi K3 Licenseが適用される。Qwen3.8-Maxの重みはQwen3.8-2.4T-A95Bとして公開されており、独自のqwen3.8-maxライセンスの対象となる。

両方とも1Mコンテキストは本物?

おおむねそうだ。Kimi K3は1,048,576トークンを仕様として掲げる。Qwen 3.8 Maxは1Mで、最大入力は991.8K。27Bはネイティブでは262,144であり、短コンテキスト品質とのトレードオフを伴うYaRNスケーリングでのみ1Mに届く。独立した検証が存在するのは248Kレベルまでだ。

結論:用途別の推奨と、判断が変わる条件

用途推奨理由
品質最優先のAPIコーディングエージェントKimi K3FrontierSWE 81.2、Terminal-Bench 88.3、AA検証済み60
コスト重視、文書・ビジョン中心のAPI利用Qwen 3.8 Max出力は$6対$15、OSWorld 86.1、明示的キャッシュ読み出しは$0.17
所有ハードウェアでセルフホストQwen3.8-27BApache-2.0、約17~29 GBの量子化版、RTX 4090 1枚で160Kコンテキスト
フロンティア級フラッグシップをセルフホストKimi K3独立したフロンティア級スコアを持つ、この中で唯一のオープンなチェックポイント。ただしクラスタ予算が必要

この表の一部を覆しうる要因は2つある。Qwen 3.8 Maxの独立評価と、独自qwen3.8-maxライセンスの規約公開だ。前者はトラッカー報告で53、K3の検証済み60に対して根拠がまだ薄い。どちらかが実現するまでは、API用途に絞ったより詳しい比較としてQwen 3.8 Max vs Kimi K3 API直接対決を参照してほしい。

関連記事: Qwen3.8-27B:確認済みの情報と、17GBで実際に動くもの · Kimi K3オープンウェイト · Qwen 3.8 Max vs Kimi K3:API編