AIREITER

MiMo-V2.6-Proレビュー:エージェント性能は強力、ただし本番運用のコストに注意

最終更新日: 2026-09-22 00:28:44

MiMo-V2.6-Proは実際に公開されており、登場直後のベンチマーク順位を考えると価格も異例に安い。ただし、あらゆる最先端モデルを置き換えられる万能選手ではない。Xiaomiがこのオープンウェイトモデルを公開したのは2026年9月21日。エージェント自動化やコスト重視のAPI利用では有力だが、ローカル運用と長時間の安定性にはまだ慎重さが必要だ。

Xiaomi MiMo-V2.6の公式リリースページ

MiMo-V2.6-Proを選ぶべきか、用途別に判断する

必要なものおすすめ理由
低コストなエージェントAPIの検証MiMo-V2.6-Proを試すArtificial Analysisでは、入力100万トークンあたり$0.435、出力100万トークンあたり$0.87、Intelligence Indexは46とされている。
オープンウェイトとマルチモーダル入力候補に入れるXiaomiおよび独立系のモデルページによれば、テキスト、画像、音声・スピーチ、動画の入力に対応し、コンテキスト長は100万トークン。
簡単なローカル導入最初の選択肢にはしないOpenLMのサービング例では、SGLang向けに16-wayテンソル並列、エキスパート並列、2ノード構成を使っている。
難度の高いターミナル操作やセキュリティ作業自分のワークロードで検証する公開結果では、一部のエージェント系テストでMiMoが上回る一方、Terminal Bench 4.0とExploitBenchでは後れを取っている。
現在すぐに使える長時間自律エージェント監視付きで試験導入する初期ユーザーからフリーズ、冗長さ、アクションの遅延が報告されている。しかも公開後の情報はまだ数時間分にすぎない。

独立系のArtificial Analysisのモデルページでは、スコア46、出力速度は毎秒約129.7トークン、Intelligence Indexのタスクあたり推定コストは$0.13と記録されている。比較材料としては有用だが、手元のプロンプトや利用するプロバイダーで同じ結果になることを保証する数字ではない。

2026年9月21日にXiaomiが公開したもの

Xiaomiの公式MiMo-V2.6発表が示しているのは、単一のチェックポイントではなくモデルファミリーだ。最上位モデルがMiMo-V2.6-Pro、より効率を重視した小型モデルがMiMo-V2.6-Flashで、強化学習研究向けにはQwenベースの9B蒸留モデルも含まれている。

Proは、スパースなMixture-of-Experts構成を採用したオープンウェイトモデルだ。公開仕様によると、総パラメーター数は約1.02兆、アクティブパラメーター数は420億。コンテキスト長は100万トークンで、テキスト、画像、動画、音声をネイティブに扱えると説明されている。

Artificial Analysisでは、ProのライセンスをMITと記載し、ウェイトを自前でホスティングできるとしている。ただし、それだけでホスティングAPIやサービング構成がすべて同じになるわけではない。プロバイダーごとの制限、実装の違い、運用コストは別途考える必要がある。

今回のリリースは、学習方法の面でも注目される。Xiaomiによれば、コーディング、汎用エージェント、ビジュアルタスク、サイバーセキュリティを対象に、単一の混合強化学習プロセスを実施した。OpenLMの技術概要には、1ステップあたり1,568プロンプト、プロンプトごとに16ロールアウトを行い、グループ単位の評価とRL後の蒸留を組み合わせたというXiaomiの説明がまとめられている。

MiMo-V2.6-Proが本当に強い領域

MiMo-V2.6-Proの強みが最もはっきり出るのは、純粋な学術的コーディングよりもエージェント的な仕事だ。OpenLMが掲載する評価表では、AutomationBenchでProが53.1。Claude Opus 5の50.3、GPT-5.6 Solの45.8を上回っている。Terminal Bench 2.1でも89.9を記録し、掲載されているClaude Opus 5の89.1、GPT-5.6 Solの88.8をわずかに上回った。

ただし、すべてのテストで優位に立つわけではない。DeepSWE v1.1では71.9で、Claude Opus 5の74.0、GPT-5.6 Solの73.0を下回る。MiMo VisualCodingは72.3で、GPT-5.6 Solの73.4には届かない一方、Claude Opus 5の70.0は上回っている。

この結果から導けるのは、かなり具体的な推奨だ。MiMo-V2.6-Proは、ツール利用、ワークフロー自動化、ビジュアルコーディング、コストを抑えたいソフトウェアエージェントの候補として評価するのがよい。公開されているProgramBenchのスコアは26.5で、Claude Opus 5の37.0を下回るため、あらゆるコーディング作業で最強のモデルだと考えるべきではない。

Artificial Analysisは、目立つベンチマーク以外にも実用面の指標を示している。同ページによれば、出力速度は毎秒129.7トークン、初回トークンまでの時間は2.17秒、コンテキスト長は100万トークン。Model Pickerのスナップショットでは毎秒134トークン、エンドツーエンドの時間は20.8秒とされているが、スナップショットのインデックスのバージョンは記録されていない。これらは永続的な仕様ではなく、特定時点の測定値として扱うべきだ。

評価を左右する弱点と運用上の注意点

最大の注意点は、性能にばらつきがあることだ。OpenLMの表では、MiMo-V2.6-ProのTerminal Bench 4.0スコアは34.9。Claude Opus 5の49.0、GPT-5.6 Solの39.9、Claude Fable 5の42.4を下回っている。ExploitBenchでもProは47.9にとどまり、Claude Opus 5の70.0、GPT-5.6 Solの78.5には大きく及ばない。

サイバーセキュリティ分野の結果は、特に過大評価しやすい。ProはCyberGymで94.0という高いスコアを出しているが、ExploitBenchでは大幅に低い。あるセキュリティスイートで高得点を取ったからといって、攻撃的セキュリティ全般に強いとは限らない。

初期コミュニティの反応からは、ベンチマーク表だけでは見えない運用上の懸念も浮かぶ。モデル公開からまだ数時間しか経っていないため、初期のX上の議論は小規模だ。ユーザーの1人である@nilansahaは、次のように書いている。

「唯一の不満は、少し話しすぎることと、アクションを起こすまでにかなり時間がかかることです」

別のユーザー@benjituskは、「mimo-v2.6-proが5分ほどフリーズした」と報告している。いずれも個別の初期報告であり、実測された失敗率ではない。それでも、監視なしで迅速に動作しなければならないエージェントでは無視できない情報だ。

また、@luislucatero21は、Pelican SVGのテストでMiMo-V2.6-Proを使ったところ、コストは$0.05、所要時間は6分9秒だったと報告している。同じユーザーの環境では、Grok 4.7は$1.20、14分だったという。コストと時間を考えるうえで参考になる事例ではあるが、管理された条件でのベンチマークではない。

料金とデプロイ:まずAPI、ローカル運用はその後

MiMo-V2.6-Pro APIの項目掲載価格
キャッシュヒット時の入力100万トークンあたり$0.0036
キャッシュミス時の入力100万トークンあたり$0.435
出力100万トークンあたり$0.87
Artificial Analysisのタスク推定1タスクあたり$0.13

トークン単価はBrockerのリリース分析にある技術的な料金比較から引用したものだ。Artificial Analysisも、通常料金としておおむね入力100万トークンあたり$0.435、出力100万トークンあたり$0.87、さらにキャッシュ利用時99%割引を掲載している。キャッシュの扱い、推論トークンのカウント方法、実際に利用するプロバイダーによって請求額は変わりうる。

ローカル運用となると話は難しくなる。OpenLMのデプロイノートにあるSGLangの例では、--tp 16--dp 2--ep 16、2ノード構成、最大128同時実行リクエストを指定している。vLLMの例でも、テンソル並列度は8、GPUメモリ使用率は95%だ。これらのコマンドから自前運用が可能だとは分かるが、一般ユーザー向けの手軽な構成ではない。

多くのチームにとって合理的な順番は、まずAPIで試し、その後にインフラを判断することだ。1.02兆パラメーターのスパースモデル向けにハードウェアを購入する前に、タスクの成功率、ツール呼び出しの遅延、出力の長さ、リトライ回数、総トークンコストを測定したい。

今すぐMiMo-V2.6-Proを使うべきユーザー

オープンウェイト、マルチモーダル入力、長いコンテキスト、低い出力料金が必要なワークロードなら、APIの試験導入にMiMo-V2.6-Proを選ぶ価値がある。単発のコード問題ではなく、ワークフローを完了できたかどうかで評価する自動化中心のアプリケーションとは特に相性がよい。

自前運用を選ぶのは、分散GPUサービングをすでに運用しており、ウェイトやデプロイを自分で管理したい場合に限るべきだ。MITライセンスと公開チェックポイントは助けになるが、公開されているデプロイ手順が示すメモリ、ネットワーク、サービング、可観測性に関する作業まで不要になるわけではない。

最も難しいターミナル環境、攻撃的セキュリティ評価、あるいは5分間のフリーズが許されない監視なしのアクションが中心なら、別のモデルを選ぶか、フォールバックを用意したい。MiMo-V2.6-Proが抱える最大の未解決ポイントは明確だ。トークン単価は魅力的だが、その節約を信頼できる形で実現するための運用コストは、API料金から想像するよりはるかに高くなる可能性がある。

MiMo-V2.6-Pro FAQ

MiMo-V2.6-Proは正式にリリースされていますか?

はい。XiaomiのMiMoアカウントと公式MiMoドキュメントは、2026年9月21日にProとFlashを発表しており、オープンウェイトと関連する研究資料も公開されています。

MiMo-V2.6-Proはオープンソースですか?

オープンウェイトモデルとして配布されており、Artificial AnalysisではMITライセンスと記載されています。商用導入の前には、利用するチェックポイントとプロバイダーの規約を確認してください。

MiMo-V2.6-Proのコンテキスト長はどのくらいですか?

公開仕様では最大100万トークンです。実際に利用できるコンテキスト量は、サービングエンドポイント、プロンプトの構成、対象タスクにおける長文コンテキストの品質によって変わります。

MiMo-V2.6-Proはコーディングに向いていますか?

公開されている表では、DeepSWE v1.1で71.9、AutomationBenchで53.1を記録するなど、複数のエージェント型コーディング・自動化評価で強さを見せています。一方、ProgramBenchとTerminal Bench 4.0では、一部のクローズドな競合モデルを下回ります。

MiMo-V2.6-Pro APIの料金はいくらですか?

通常料金は、キャッシュミス時の入力が100万トークンあたり$0.435、出力が100万トークンあたり$0.87です。キャッシュヒット時の入力は100万トークンあたり$0.0036と記載されています。導入前に、現在のプロバイダーの請求条件を確認してください。

ProとFlashのどちらを使うべきですか?

公開比較では、Proのほうが高い能力を持つモデルとして位置付けられています。Flashはより効率を重視した姉妹モデルで、Brockerの料金表ではProより安い。ただし、名前だけで本番環境に最適なモデルを判断せず、自分のワークロードでレイテンシーとタスク成功率をテストしたい。