AIREITER
APIドキュメント料金
テンプレート
  • AIReiter
  • ブログ
  • Kimi K3のオープンウェイト公開:1.56TBを動かせるのは誰か

Kimi K3のオープンウェイト公開:1.56TBを動かせるのは誰か

最終更新日: 2026-07-28 08:17:19

Moonshotは、APIでKimi K3を提供開始してから11日後の2026年7月27日、オープンウェイトを公開した。誰でも実際にダウンロードできる。しかし、96個のsafetensorsシャードで合計1.56TBという規模を前にすると、「オープン」であることと「自分で動かせる」ことは別の話だとすぐに分かる。公開された内容、ライセンスの条件、実運用に必要な環境を見ていこう。

公開されたKimi K3の中身

完全なチェックポイントはHugging Faceのmoonshotai/Kimi-K3で配布されており、中国のユーザー向けにはModelScope mirrorも用意されている。リポジトリの総容量は1.56TB。96個のsafetensorsシャードに加え、config.json、モデルとトークナイザーのコード(modeling_kimi_k3.py、encoding_k3.py、16万語彙のtiktokenモデル)、Visionの前処理、LICENSEファイルが含まれる。technical reportも、MoonshotAIのGitHubリポジトリで同時に公開された。

1.56TBのリポジトリ、kimi-k3ライセンスタグ、6.6k likesを表示したmoonshotai/Kimi-K3のHugging Faceファイル一覧

注目すべきなのは、見出しのパラメータ数そのものよりモデルカードに記載された次の3点だ。

  • 実際に有効化されるのは104Bパラメータ。総パラメータ数2.8Tのうち、トークンごとに896個のルーティング専門家から16個、さらに共有専門家2個が選ばれる。これを93層で構成する。このアクティブパラメータ数は、ウェイト公開前には明かされていなかった。
  • ウェイトはネイティブMXFP4形式。MoonshotはSFT段階以降で量子化対応学習を実施し、アクティベーションにはMXFP8を採用している。BF16チェックポイントを後から量子化したものではない。今回公開された4ビットウェイトそのものが、K3の本来のリリース形式だ。
  • Attentionは69対24の構成。1,048,576トークンのコンテキストウィンドウにわたり、Kimi Delta Attention層とGated MLA層を69/24で組み合わせている。

反応は速かった。最初のコミットが入った翌日、2026年7月28日時点でリポジトリはcommit history上で6.6k likesを集めていた。コミュニティによる変換版もすでに登場しており、unsloth/Kimi-K3-GGUFは同日の夜に作成され、翌朝までにはGrEarl/Kimi-K3-GGUFへ完全なQ2_K変換版がアップロードされている。

Kimi K3 LicenseはMITライセンスではない

従来のKimiフラッグシップモデルはModified MITライセンスで提供されていた。K3は違う。適用されるのはKimi K3 Licenseという独自文書だ。本文はMIT由来で、利用、複製、改変、統合、公開、配布、サブライセンス、販売、ファインチューニング、派生物の作成を認めている。ただし、これを基盤に何かを作る前に確認すべき条件が2つ追加されている。

Model-as-a-Service条項。要点は次のとおりだ。「ライセンシーまたはその関連会社がModel as a Service事業を運営し、ライセンシーおよび関連会社の合計収益が連続する任意の12か月間で2,000万米ドルを超える場合、商用目的でSoftwareまたはその派生物を使用する前に、Moonshot AIと別途契約を締結しなければならない」。ライセンスにおけるMaaSとは、第三者が入力、パラメータ、トレーニングデータを制御できる形で、推論またはファインチューニングへのアクセスを提供することを指す。一方で、特定機能にモデルの能力を組み込んだエンドユーザー向け製品と、他社がホストするモデルへのリクエストを単に中継する行為は、明示的にMaaSから除外されている。

表示義務に関する条項。K3を基盤とする商用製品が月間アクティブユーザー数1億人、または月間売上2,000万USDを超えた場合、その製品のUIに「Kimi K3」を目立つ形で表示しなければならない。

両方の条項は、純粋な社内利用、すなわち第三者にモデル、その出力、能力を提供しない利用では免除される。また、Moonshotの公式製品または認定推論パートナー経由でのアクセスも対象外だ。免除規定を文面どおりに読むなら、社内データでK3をファインチューニングする行為はSection 4(a)の社内利用の例外に含まれる。また、製品機能として組み込むことも、Section 2でMaaSではないとされている。追加条項が主に想定しているのは、K3の推論をサービスとして再販するケースであり、収益が2,000万ドルに達した時点で、ライセンスの解釈ではなく契約交渉の問題になる。導入方針を固める前に、必ずLICENSE原文を確認してほしい。ここでの説明は条文の読み取りであり、法的助言ではない。

1.56TBを運用するための現実的なハードウェア

Kimi K3のオープンウェイトは誰でもダウンロードできる。だが、サービングできる環境を持つ人は限られる。

vLLMのofficial K3 recipeは必要要件を明記している。最低でも8× GB300、本番トラフィックを扱うならマルチノード構成が必要だ。AMD環境では、ROCmイメージで少なくとも8× MI355XまたはMI350Xを挙げている。SGLangも同等クラスの構成を前提とするK3 cookbookを公開している。

実際に環境を用意するなら、レシピの運用メモこそ念入りに読むべき部分だ。サービングには通常版vLLMではなく、専用イメージのvllm/vllm-openai:kimi-k3、AMDではvllm/vllm-openai_rocm:kimi-k3を使う。ノード間通信では、RDMAなら--all2all-backend deepep_v2、NVLinkならflashinfer_nvlink_one_sidedが推奨される。KVキャッシュ転送をRDMA上に維持するには、UCX_TLS="rc,cuda_copy"の設定も必要になる。MoEバックエンドはトポロジーに応じて使い分ける。expert-parallel構成ならdeep_gemm_mega_moe、TP>1ならflashinfer_trtllmだ。また、K3は自身のパーサーが受理できないツールコール形式を出力することがあるため、サービング層には初日からスキーマ検証とリトライを組み込むべきだとされている。

このモデルでは、定番の逃げ道である追加量子化もほぼ通用しない。MXFP4はすでにパラメータあたり約4.25ビットだからだ。これまで1T級モデルをワークステーションへ持ち込むために使われていた圧縮余地は、ダウンロード前の時点ですでに使われている。最初に登場したコミュニティ製2ビットGGUF変換版でも、94シャードで928GBある。40%削減ではあるが、そもそも容量だけが制約だったわけではない。

読み込むもの容量
公式MXFP4 safetensors1,561 GB
コミュニティ製Q2_K GGUF929 GB
トークンあたりのアクティブパラメータ104B

1Mトークンに近いコンテキストを使うためのKVキャッシュも追加すれば、必要なワーキングセットはさらに増える。公開初日のセルフホスト報告で特に目を引いたのは、公式MXFP4ウェイトを80× RTX 5090で動かしたとするチームの投稿だ。HBMなし、再量子化なし、通常のEthernet接続で、チューニング前のシングルストリーム性能はおよそ20トークン/秒としている。ただし、これは単一投稿による未監査の初日報告であり、ベンチマークではない。1つの構成から最低要件を決めることもできない。引ける教訓は方向性だけだ。コンシューマー向けシリコンでK3を動かす最も安価な報告例でさえ、フラッグシップGPUを80枚使い、多くの人が遅いと感じる速度にとどまった。

多くの人が最初に試すOllamaについても、明確にしておきたい。ライブラリエントリ自体はあるものの、実体はローカルプルではなくOllamaのホスト型ルーティングであるkimi-k3:cloudだ。現時点で、このモデルをノートPCや単体ワークステーションで動かす道はない。MXFP4は利便性のための量子化ではなくネイティブ形式なので、K2系で使えたような積極的な再量子化にも、以前ほどの余地はない。llama.cppの対応状況はなお変化しているため、対応・非対応を決めつけず最新状況を確認したい。

今すぐKimi K3を使えるホスト

ほとんどの人にとって現実的なのはホスト型エンドポイントだ。そしてオープンウェイト公開の常として、サードパーティーホストは1日以内に対応を始めた。以下の価格は、2026年7月28日時点の入出力それぞれ100万トークンあたりの掲載価格である。

ホスト量子化コンテキスト価格
Moonshot AIMXFP4(ネイティブ)1M$3 / $15
BasetenFP81M$3 / $15
Fireworks記載なし1M$3 / $15($4.50 / $22.50のティアもあり)
NebiusFP48K$3 / $15

選ぶ前に確認したい点は2つある。まず、コンテキストウィンドウには大きな差がある。Nebiusは同じ掲載価格ながら8Kウィンドウで提供しており、これはK3を使う最大の理由を取り除いてしまう。次に、量子化形式も揃っていない。MoonshotはネイティブMXFP4、BasetenはFP8で提供し、精度を明記していないホストも複数ある。長期的なエージェント型ワークロードでは、一般に価格差よりも、リファレンス精度と完全な1Mウィンドウに合わせることの方が重要だろう。一方、短いプロンプトを大量に処理する用途なら、レイテンシやリージョンの利用可能性がどちらより優先される可能性がある。

直接提供されるエンドポイント以外では、OpenRouterが1つのキーで各ホストを集約している。マルチモデルゲートウェイでは、K3を他の中国発オープン・フロンティアモデルと並べてルーティングできる。既存ツールがそのプロトコルに対応しているなら、AIReiterも同クラスのモデルをAnthropic-compatible API経由で提供している。Moonshot自身のエンドポイントはOpenAI互換とAnthropic互換の両方に対応する。レート制限とティアの詳細は、Kimi K3 pricing breakdownを参照してほしい。

セルフホストとホスト型API、どちらを選ぶべきか

まずは計算しよう。100万トークンあたり入力$3、出力$15なら、出力10億トークンは$15,000、入力10億トークンは$3,000だ。比較対象となるセルフホストの最低ラインは、8× GB300クラスのノードになる。データセンター向けの設備投資、またはアクセラレータ時間で課金されるレンタルに加え、インターコネクト、電力、冷却、そして--all2all-backendを使いこなせるエンジニアも必要だ。NVIDIAも主要クラウドもこの構成の定価を公開していないため、目安ではなく現在の見積もりを基に比較するべきである。また、ハードウェア費用は固定だが、API費用は実際の利用量に応じて増減する点も忘れてはならない。

Kimi K3のオープンウェイトをセルフホストする意味が出る状況は、次の3つに限られる。見た目ほど広い条件ではない。

  1. エアギャップ環境またはデータ所在地の要件。第三者エンドポイントでは満たせない要件がある場合だ。最も強い導入理由であり、費用は判断の決め手ではない。
  2. 独自データでのファインチューニング。ライセンス上は明確に許可されており、ホスト型エンドポイントでは得られない能力でもある。なお、学習コストはサービングコストとは別で、より大きい。
  3. 常時飽和する継続的な利用量。マルチノードクラスタを24時間稼働させ続けるなら、所有ハードウェアはトークン単価を下回り得る。断続的なスパイク利用はこれに当てはまらない。

これらのどれにも当てはまらないなら、エンドポイントを使い、ウェイトは導入計画ではなく選択肢として捉えるのがよい。多くのチームにとって、オープンウェイトのフロンティアモデルの価値は、自分たちで実行することではない。必要なら実行できるという可能性が、ホスト版の価格競争力を支えることにある。

FAQ

Kimi K3はオープンソースですか?

オープンウェイトモデルだ。完全な2.8Tチェックポイントをダウンロードでき、Kimi K3 Licenseは利用、改変、配布、ファインチューニングを認めている。一方、学習データと完全なトレーニングパイプラインは公開されていない。また、Model-as-a-Service事業者には収益に応じた条項が追加されているため、OSI流のオープンソースではない。

Kimi K3をOllamaでローカル実行できますか?

できない。Ollamaのkimi-k3エントリは、ホスト型エンドポイントへルーティングするkimi-k3:cloudだ。ネイティブMXFP4ウェイトは1.56TBで、コミュニティ製2ビットGGUFでも928GBあるため、コンシューマーハードウェアでローカル実行する道はない。

Kimi K3のウェイトにはどのライセンスが適用されますか?

Kimi K3 Licenseだ。MIT由来だが、任意の12か月間で収益が$20Mを超えるModel-as-a-Service事業を運営する場合、Moonshotとの別途契約を求めている。また、月間アクティブユーザー数100M超または月間収益$20M超ではUI上の表示義務がある。社内利用は両方の対象外だ。

ダウンロードせずにKimi K3を使える場所は?

Moonshot自身のAPIとKimiアプリのほか、Baseten、Fireworks、Nebiusで利用できる。2026年7月28日時点では、4社とも基本料金として100万トークンあたり$3/$15を掲載している。ただし比較には条件がある。Fireworksには$4.50/$22.50のティアもあり、Nebiusは1Mではなく8Kのコンテキストウィンドウで基本料金を提供している。モデルの概要やベンチマークについては、Kimi K3 overviewを参照してほしい。

>_AIReiter モデルディレクトリ

このガイドに関連するモデルへ素早く API アクセス

Kimi K3

Chat

コーディング、文章作成、分析、エージェントワークフロー向けの長文脈推論モデル。

MoonshotAPI Key を作成 >

Claude Fable 5

Chat

深い推論と複雑な長文作業向けのプレミアムClaudeモデルです。

AnthropicAPI Key を作成 >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicAPI Key を作成 >

Claude Opus 4.8

Chat

高度な推論やプロフェッショナルな作業に対応する高性能なClaudeモデルです。

AnthropicAPI Key を作成 >

Claude Opus 5

Chat

複雑な推論、コーディング、長文コンテキストの専門的な作業向けのプレミアムなClaudeモデルです。

AnthropicAPI Key を作成 >

最近の記事

Janitor AIでDeepSeekを使う方法(2026年設定ガイド)

2026-09-08

無料LLM APIのクオタを比較:11社まとめ(2026年)

2026-09-08

Muse Spark 1.3 API料金ガイド:StandardとContributorを比較

2026-09-08

GPT-6 Astra APIレビュー(2026年):エージェント向けで、単純な置き換えには向かない

2026-09-07
AIREITER

ご質問はお問い合わせください
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI動画

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI画像

Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image TurboKrea 2 Turbo

ブログ

すべて表示 →

会社

プライバシーポリシー利用規約返金ポリシー

© 2026 AIReiter. All rights reserved.