MiMo-V2.6-Proは実際に公開されており、登場直後のベンチマーク順位を考えると価格も異例に安い。ただし、あらゆる最先端モデルを置き換えられる万能選手ではない。Xiaomiがこのオープンウェイトモデルを公開したのは2026年9月21日。エージェント自動化やコスト重視のAPI利用では有力だが、ローカル運用と長時間の安定性にはまだ慎重さが必要だ。
MiMo-V2.6-Proを選ぶべきか、用途別に判断する
| 必要なもの | おすすめ | 理由 |
|---|---|---|
| 低コストなエージェントAPIの検証 | MiMo-V2.6-Proを試す | Artificial Analysisでは、入力100万トークンあたり$0.435、出力100万トークンあたり$0.87、Intelligence Indexは46とされている。 |
| オープンウェイトとマルチモーダル入力 | 候補に入れる | Xiaomiおよび独立系のモデルページによれば、テキスト、画像、音声・スピーチ、動画の入力に対応し、コンテキスト長は100万トークン。 |
| 簡単なローカル導入 | 最初の選択肢にはしない | OpenLMのサービング例では、SGLang向けに16-wayテンソル並列、エキスパート並列、2ノード構成を使っている。 |
| 難度の高いターミナル操作やセキュリティ作業 | 自分のワークロードで検証する | 公開結果では、一部のエージェント系テストでMiMoが上回る一方、Terminal Bench 4.0とExploitBenchでは後れを取っている。 |
| 現在すぐに使える長時間自律エージェント | 監視付きで試験導入する | 初期ユーザーからフリーズ、冗長さ、アクションの遅延が報告されている。しかも公開後の情報はまだ数時間分にすぎない。 |
独立系のArtificial Analysisのモデルページでは、スコア46、出力速度は毎秒約129.7トークン、Intelligence Indexのタスクあたり推定コストは$0.13と記録されている。比較材料としては有用だが、手元のプロンプトや利用するプロバイダーで同じ結果になることを保証する数字ではない。
2026年9月21日にXiaomiが公開したもの
Xiaomiの公式MiMo-V2.6発表が示しているのは、単一のチェックポイントではなくモデルファミリーだ。最上位モデルがMiMo-V2.6-Pro、より効率を重視した小型モデルがMiMo-V2.6-Flashで、強化学習研究向けにはQwenベースの9B蒸留モデルも含まれている。
Proは、スパースなMixture-of-Experts構成を採用したオープンウェイトモデルだ。公開仕様によると、総パラメーター数は約1.02兆、アクティブパラメーター数は420億。コンテキスト長は100万トークンで、テキスト、画像、動画、音声をネイティブに扱えると説明されている。
Artificial Analysisでは、ProのライセンスをMITと記載し、ウェイトを自前でホスティングできるとしている。ただし、それだけでホスティングAPIやサービング構成がすべて同じになるわけではない。プロバイダーごとの制限、実装の違い、運用コストは別途考える必要がある。
今回のリリースは、学習方法の面でも注目される。Xiaomiによれば、コーディング、汎用エージェント、ビジュアルタスク、サイバーセキュリティを対象に、単一の混合強化学習プロセスを実施した。OpenLMの技術概要には、1ステップあたり1,568プロンプト、プロンプトごとに16ロールアウトを行い、グループ単位の評価とRL後の蒸留を組み合わせたというXiaomiの説明がまとめられている。
MiMo-V2.6-Proが本当に強い領域
MiMo-V2.6-Proの強みが最もはっきり出るのは、純粋な学術的コーディングよりもエージェント的な仕事だ。OpenLMが掲載する評価表では、AutomationBenchでProが53.1。Claude Opus 5の50.3、GPT-5.6 Solの45.8を上回っている。Terminal Bench 2.1でも89.9を記録し、掲載されているClaude Opus 5の89.1、GPT-5.6 Solの88.8をわずかに上回った。
ただし、すべてのテストで優位に立つわけではない。DeepSWE v1.1では71.9で、Claude Opus 5の74.0、GPT-5.6 Solの73.0を下回る。MiMo VisualCodingは72.3で、GPT-5.6 Solの73.4には届かない一方、Claude Opus 5の70.0は上回っている。
この結果から導けるのは、かなり具体的な推奨だ。MiMo-V2.6-Proは、ツール利用、ワークフロー自動化、ビジュアルコーディング、コストを抑えたいソフトウェアエージェントの候補として評価するのがよい。公開されているProgramBenchのスコアは26.5で、Claude Opus 5の37.0を下回るため、あらゆるコーディング作業で最強のモデルだと考えるべきではない。
Artificial Analysisは、目立つベンチマーク以外にも実用面の指標を示している。同ページによれば、出力速度は毎秒129.7トークン、初回トークンまでの時間は2.17秒、コンテキスト長は100万トークン。Model Pickerのスナップショットでは毎秒134トークン、エンドツーエンドの時間は20.8秒とされているが、スナップショットのインデックスのバージョンは記録されていない。これらは永続的な仕様ではなく、特定時点の測定値として扱うべきだ。
評価を左右する弱点と運用上の注意点
最大の注意点は、性能にばらつきがあることだ。OpenLMの表では、MiMo-V2.6-ProのTerminal Bench 4.0スコアは34.9。Claude Opus 5の49.0、GPT-5.6 Solの39.9、Claude Fable 5の42.4を下回っている。ExploitBenchでもProは47.9にとどまり、Claude Opus 5の70.0、GPT-5.6 Solの78.5には大きく及ばない。
サイバーセキュリティ分野の結果は、特に過大評価しやすい。ProはCyberGymで94.0という高いスコアを出しているが、ExploitBenchでは大幅に低い。あるセキュリティスイートで高得点を取ったからといって、攻撃的セキュリティ全般に強いとは限らない。
初期コミュニティの反応からは、ベンチマーク表だけでは見えない運用上の懸念も浮かぶ。モデル公開からまだ数時間しか経っていないため、初期のX上の議論は小規模だ。ユーザーの1人である@nilansahaは、次のように書いている。
「唯一の不満は、少し話しすぎることと、アクションを起こすまでにかなり時間がかかることです」
別のユーザー@benjituskは、「mimo-v2.6-proが5分ほどフリーズした」と報告している。いずれも個別の初期報告であり、実測された失敗率ではない。それでも、監視なしで迅速に動作しなければならないエージェントでは無視できない情報だ。
また、@luislucatero21は、Pelican SVGのテストでMiMo-V2.6-Proを使ったところ、コストは$0.05、所要時間は6分9秒だったと報告している。同じユーザーの環境では、Grok 4.7は$1.20、14分だったという。コストと時間を考えるうえで参考になる事例ではあるが、管理された条件でのベンチマークではない。
料金とデプロイ:まずAPI、ローカル運用はその後
| MiMo-V2.6-Pro APIの項目 | 掲載価格 |
|---|---|
| キャッシュヒット時の入力 | 100万トークンあたり$0.0036 |
| キャッシュミス時の入力 | 100万トークンあたり$0.435 |
| 出力 | 100万トークンあたり$0.87 |
| Artificial Analysisのタスク推定 | 1タスクあたり$0.13 |
トークン単価はBrockerのリリース分析にある技術的な料金比較から引用したものだ。Artificial Analysisも、通常料金としておおむね入力100万トークンあたり$0.435、出力100万トークンあたり$0.87、さらにキャッシュ利用時99%割引を掲載している。キャッシュの扱い、推論トークンのカウント方法、実際に利用するプロバイダーによって請求額は変わりうる。
ローカル運用となると話は難しくなる。OpenLMのデプロイノートにあるSGLangの例では、--tp 16、--dp 2、--ep 16、2ノード構成、最大128同時実行リクエストを指定している。vLLMの例でも、テンソル並列度は8、GPUメモリ使用率は95%だ。これらのコマンドから自前運用が可能だとは分かるが、一般ユーザー向けの手軽な構成ではない。
多くのチームにとって合理的な順番は、まずAPIで試し、その後にインフラを判断することだ。1.02兆パラメーターのスパースモデル向けにハードウェアを購入する前に、タスクの成功率、ツール呼び出しの遅延、出力の長さ、リトライ回数、総トークンコストを測定したい。
今すぐMiMo-V2.6-Proを使うべきユーザー
オープンウェイト、マルチモーダル入力、長いコンテキスト、低い出力料金が必要なワークロードなら、APIの試験導入にMiMo-V2.6-Proを選ぶ価値がある。単発のコード問題ではなく、ワークフローを完了できたかどうかで評価する自動化中心のアプリケーションとは特に相性がよい。
自前運用を選ぶのは、分散GPUサービングをすでに運用しており、ウェイトやデプロイを自分で管理したい場合に限るべきだ。MITライセンスと公開チェックポイントは助けになるが、公開されているデプロイ手順が示すメモリ、ネットワーク、サービング、可観測性に関する作業まで不要になるわけではない。
最も難しいターミナル環境、攻撃的セキュリティ評価、あるいは5分間のフリーズが許されない監視なしのアクションが中心なら、別のモデルを選ぶか、フォールバックを用意したい。MiMo-V2.6-Proが抱える最大の未解決ポイントは明確だ。トークン単価は魅力的だが、その節約を信頼できる形で実現するための運用コストは、API料金から想像するよりはるかに高くなる可能性がある。
MiMo-V2.6-Pro FAQ
MiMo-V2.6-Proは正式にリリースされていますか?
はい。XiaomiのMiMoアカウントと公式MiMoドキュメントは、2026年9月21日にProとFlashを発表しており、オープンウェイトと関連する研究資料も公開されています。
MiMo-V2.6-Proはオープンソースですか?
オープンウェイトモデルとして配布されており、Artificial AnalysisではMITライセンスと記載されています。商用導入の前には、利用するチェックポイントとプロバイダーの規約を確認してください。
MiMo-V2.6-Proのコンテキスト長はどのくらいですか?
公開仕様では最大100万トークンです。実際に利用できるコンテキスト量は、サービングエンドポイント、プロンプトの構成、対象タスクにおける長文コンテキストの品質によって変わります。
MiMo-V2.6-Proはコーディングに向いていますか?
公開されている表では、DeepSWE v1.1で71.9、AutomationBenchで53.1を記録するなど、複数のエージェント型コーディング・自動化評価で強さを見せています。一方、ProgramBenchとTerminal Bench 4.0では、一部のクローズドな競合モデルを下回ります。
MiMo-V2.6-Pro APIの料金はいくらですか?
通常料金は、キャッシュミス時の入力が100万トークンあたり$0.435、出力が100万トークンあたり$0.87です。キャッシュヒット時の入力は100万トークンあたり$0.0036と記載されています。導入前に、現在のプロバイダーの請求条件を確認してください。
ProとFlashのどちらを使うべきですか?
公開比較では、Proのほうが高い能力を持つモデルとして位置付けられています。Flashはより効率を重視した姉妹モデルで、Brockerの料金表ではProより安い。ただし、名前だけで本番環境に最適なモデルを判断せず、自分のワークロードでレイテンシーとタスク成功率をテストしたい。