Muse Spark 1.3は、OpenRouterで入力100万トークンあたり$1.25、出力100万トークンあたり$4.25で提供されています。ただし、料金だけで導入を決めるのは早計です。長いコンテキストを扱うコーディングやエージェント処理ではかなり有望な一方、リリースから日が浅く、ローンチ時点ではmax reasoningが有効になっておらず、最初のトークンが返るまで大きく待たされることもあります。
Muse Spark 1.3とは何か。現在の「利用可能」の意味
Muse Spark 1.3は、長時間にわたるエージェント処理、コーディング、マルチモーダルタスクを想定したMeta独自の推論モデルです。Metaは2026年9月2日に発表し、Muse CodeとMeta Model APIへの展開を開始しました。既存の推論モードが先に利用可能となり、max reasoningには追加の安全性テストが必要とされています。(Meta AI Researchの発表)
発表画像にはmaxの結果も掲載されていますが、max reasoningは追加の安全性テスト待ちでした。したがって、画像にある数値が初日からそのまま再現できるとは考えないほうがよいでしょう。
Metaによると、Muse Spark 1.3は長いタスクの途中でも制約を維持しやすくなり、同じスレッド内での割り込みへの対応、確認質問、重要な操作の前の承認要求、行き詰まった際の自己申告も改善されています。また、社内のコーディング比較ではMuse Spark 1.2よりツール呼び出しが約20%、トークン使用量が25%少ないとしています。ただし、これは再現可能なタスクセットや誤差範囲を伴わない、ベンダー報告の数値です。
ローンチ記事では、オープンウェイト化は将来のロードマップとして説明されています。今回確認した情報では、Muse Spark 1.3はホスティング/API専用モデルとして掲載されており、ダウンロード可能なチェックポイント、確定したライセンス、パラメーター数、必要なハードウェアについては明記されていません。
API料金は明快でも、実際のコスト判断は単純ではない
最も明確な公開料金表は、Metaのローンチ記事ではなくOpenRouterのMuse Spark 1.3ページです。OpenRouterでは、入力と出力の標準料金をそれぞれ100万トークンあたり$1.25、$4.25と案内しており、キャッシュ読み取りとウェブ検索には別料金がかかります。
| 用途 | 掲載料金 | 確認したい点 |
|---|---|---|
| 入力 | 100万トークンあたり$1.25 | 新規プロンプトとコンテキストのトークン |
| 出力 | 100万トークンあたり$4.25 | 入力料金の約3.4倍 |
| キャッシュ読み取り | 100万トークンあたり$0.15 | エージェントで同じコンテキストを繰り返し使う場合に有効 |
| ウェブ検索 | 1,000回あたり$2.50 | トークン料金とは別に発生 |
新規入力が100,000トークン、出力が20,000トークンのリクエストなら、キャッシュやウェブ検索の料金を除いて約$0.21です。内訳は入力$0.125、出力$0.085。実際のタスクでは、エージェントのループ、リトライ、コンテキストの再送によってコストが上がります。
Artificial Analysisの報告では、キャッシュヒット・入力・出力を7:2:1の比率で想定した場合のブレンド価格を1トークンあたり100万トークン換算で$0.78としています。新規コンテキストが中心の処理や出力の多いワークロードでは、これより高くなります。普遍的な料金ではなく、特定シナリオの試算として見るべきでしょう。
Muse Spark 1.2 API料金ガイドにあるContributorの前提を、Muse Spark 1.3へそのまま当てはめないでください。1.3について公開されている標準料金は上記のとおりですが、今回確認した情報からは、データ利用、レート制限、地域ごとの提供状況を含む完全な1.3 Contributor契約は確認できません。プロバイダーから別条件を確認できるまでは、標準料金を前提に予算を組むのが安全です。
現時点の評価は「強いコーディングモデル」であって「何でも勝つモデル」ではない
現時点のデータからは、Muse Spark 1.3はコーディングと長文脈処理に強いモデルだとは言えますが、あらゆる用途で首位に立つとは言えません。以下の表はMetaがリンクしている評価方法のスコアを使用しています。ベンチマークごとに尺度が異なるため、数値を比較できるのは同じ行の中だけです。
| 評価 | Muse 1.3 max | Muse 1.3 xhigh | Muse 1.2 xhigh | GPT-5.6 Sol | Claude Opus 5 | 表中の最高値 |
|---|---|---|---|---|---|---|
| MRCR 512K–1M | 98.1 | 93.1 | 55.5 | 73.8 | — | Muse 1.3 max |
| DeepSWE v1.1 | 75.4 | — | 55.0 | 73.0 | 74.0 | Muse 1.3 max |
| SWE-Atlas Codebase QnA | 59.4 | 54.0 | 46.2 | 53.5 | 52.7 | Muse 1.3 max |
| Terminal-Bench 2.1 | 88.8 | 89.2 | 82.9 | 88.8 | 86.7 | Muse 1.3 xhigh |
| OSWorld 2.0 | 66.9 | 57.2 | 47.6 | 62.7 | 68.3 | Claude Opus 5 |
| DeepSearchQA | 89.4 | 89.4 | 85.9 | 93.0 | 90.4 | GPT-5.6 Sol |
| GDPVal-AA v2 | 1754 | 1709 | 1615 | 1710 | 1824 | Claude Opus 5 |
Muse Spark 1.3が最も力を発揮しているのは、長いコンテキストを使うコーディングです。MRCRの512K–1Mコンテキストではmaxが98.1、DeepSWEでは75.4を記録し、Muse Spark 1.2 xhighの55.5、55.0を上回っています。一方で、専門的な業務、コンピューター操作、ブラウジング関連の評価では、より強い選択肢も同じ表に示されています。
Metaの評価方法によれば、表の数値にはMeta自身の評価、公式リーダーボード、プロバイダーの自己申告結果が含まれる場合があります。コーディングテストでは利用できるツールが制限され、外部インターネットにも接続していません。したがって、これらは有力な判断材料ではあるものの、第三者が同じ条件で一括再検証した比較ではありません。
Artificial Analysisの報告では、Intelligence Indexが61、比較可能な196モデル中#10です。比較対象モデルの中央値は36でした。ModelCapではModelCap Indexが81.7、ボード順位が#4となっていますが、支持度は20%、公開ベンチマークの観測数は1件にとどまります。評価システムによって結果が異なることからも、根拠となるデータはまだ薄いと分かります。
実際のワークフローで試すなら、まずはリポジトリの探索、長時間のターミナルエージェント、コードベースへの質問応答が候補です。ブラウジングの比重が高いタスクや、専門的なコンピューター操作全般に同じ結果が出るとは考えないでください。
速度の逆説。生成は速いが、生成開始までが遅い
Muse Spark 1.3は、いったん生成が始まれば速いようです。しかし、最初に見える回答が返るまでにはかなり時間がかかる場合があります。各ターンをすぐに始めたい対話的なコーディングより、継続処理やバッチ処理に向いた特性です。
Artificial Analysisによると、出力速度は毎秒181.7トークンで、比較対象モデルの中央値68.1を大きく上回ります。一方、初回トークンまでの時間は27.51秒で、中央値は3.04秒です。同社のワークロードでは、500トークンの回答に41.26秒かかると推定されています。プロバイダーページでは、最初の回答トークンまで38.51秒、1回のIntelligence Indexタスクあたりのコストは$0.55とされています。
OpenRouterが表示するP50値は異なり、毎秒62トークン、レイテンシ1.83秒です。ページごとにワークロードや指標の定義が異なり、Artificial Analysisの初回回答指標には推論時間も含まれるため、これらを直接比較することはできません。自分のテスト環境で、初回トークンまでの時間とタスク完了までの総時間をそれぞれ測定してください。
「何人かが聞いているので、初期段階の感想(いま実行中)を書くと、機械的な感じがする(仕事には最高だが、戦略的な用途は分からない)。かなり有能で、とても速そうだ」— u/NewYak4281、r/singularity
この管理されていない初期所感は、測定値が示すトレードオフとも一致します。生成が始まった後は速いものの、そこに至るまで長く待つ可能性があり、対話の手触りは機械的に感じられるかもしれません。参考にはなりますが、管理されたテストの代わりにはなりません。
本番投入前に確認したいAPI機能と提供上の制限
Muse Spark 1.3には、現代的なエージェントモデルに期待される統合機能がそろっています。ただし、本番運用に関わる詳細の一部はプロバイダー依存で、未公開のままです。現時点で最も強いAPIの根拠は、ローンチ記事にある完全なMeta仕様ではなく、OpenRouterの稼働中モデルページとArtificial Analysisのプロバイダー追跡情報です。
| 機能・制限 | 現在確認できる情報 | 本番運用への影響 |
|---|---|---|
| コンテキストウィンドウ | OpenRouterとModelCapは1,048,576トークンと掲載 | 実際に利用するエンドポイントの上限を確認する |
| 最大出力 | ModelCapは944Kトークンと掲載 | プロバイダー側の出力上限はこれより低い可能性がある |
| 入力 | テキスト、画像、動画、ファイル。音声は注意書き付き | 音声理解は未完成の機能として扱う |
| 出力 | テキスト | テキストを介したワークフローを設計する |
| ツール呼び出し | 対応と掲載 | 利用するSDKでスキーマとツールエラーをテストする |
| 構造化出力 | JSON Schema形式のレスポンスが掲載 | 厳格なスキーマに失敗した場合を確認する |
| プロバイダー数 | OpenRouterページとArtificial Analysisの追跡ページではMetaプロバイダー1社を確認 | 障害時の冗長化を前提にしない |
| モデルウェイト | API専用。ダウンロード可能なウェイトは掲載なし | セルフホスティングの手段は確立されていない |
ModelCapは、個々のプロバイダーが公開最大値より低いコンテキスト上限や出力上限を設定する場合があると注意しています。OpenRouterの提供状況パネルでは、3日間の稼働率が99.97%と表示されていますが、72時間および24時間の表示ではより低い数値になっています。これはページごとに異なる指標なので、本番トラフィックを振り分ける際は最新のステータス情報と自分のエラーログを使って判断してください。
Metaはローンチ記事で、パラメーター数、アーキテクチャー、正式なAPIレート制限、ライセンス条件、詳細な安全性テスト結果を公開していません。プロンプトインジェクションへの耐性や、不可逆な操作に対する判断力が向上したとは説明していますが、攻撃成功率や再現可能なレッドチーム手順までは示していません。
Muse Spark 1.3は今すぐ使うべきか
Muse Spark 1.3は、初回レスポンスの速さよりも低いトークンコストと生成の持続性が重要な、長文脈コーディングやツールを多用するエージェントであれば、今から試す価値があります。一方、レイテンシーに敏感なシステム、音声中心のワークフロー、プライバシー要件の厳しい環境、冗長性が不可欠なサービスで、唯一の本番モデルにする準備はまだ整っていません。
| 状況 | 判断 |
|---|---|
| 大規模リポジトリ、コードベースQ&A、長時間のターミナルタスク | Muse Spark 1.3を最初に試す |
| 出力速度が重要なバッチ型エージェント処理 | 有力候補。タスク全体のコストを測定する |
| 対話的なペアプログラミング | 初回トークンまでの遅延を許容できる場合に限る |
| 音声中心のワークフロー | 待つか、音声対応を確認できたモデルを選ぶ |
| 機密性の高い顧客コードや規制対象データ | まずデータ利用条件を確認する |
| フェイルオーバーが必要なミッションクリティカルサービス | 2つ目のモデルとルーティングを用意する |
リーダーボードのスクリーンショットを増やすより、リスクを抑えた小規模導入のほうが有益です。
- 機密情報を含まないリポジトリと、固定した5〜10個のタスクから始める。
- シェル、ファイル書き込み、ネットワーク、破壊的な操作の権限を必要最小限に制限する。
- 完了率、ツール呼び出し回数、初回トークンまでの時間、所要時間、トークン数、請求額を記録する。
- 現在の基準モデルで同じタスクを実行して比較し、タイムアウトや信頼度の低い編集に備えてフォールバックを残す。
コーディングエージェントでは、まず実験フラグの背後にMuse Spark 1.3を置き、ローンチ当日の順位ではなく、実際のリポジトリテストで判断しましょう。料金の安さと長文脈での結果は試す理由になります。一方、初動の遅さ、少ないプロバイダー、未完成の音声対応、暫定的なベンチマーク評価は、単独モデルとしての全面的な採用をためらわせる材料です。
Muse Spark 1.3 APIと料金に関するFAQ
Muse Spark 1.3は正式リリースされていますか?
はい。Metaは2026年9月2日の発表で、Muse Spark 1.3をMuse CodeとMeta Model APIで展開していると説明しています。max reasoningについては、追加の安全性テストがまだ必要な段階でした。
Muse Spark 1.3にはどこからアクセスできますか?
MetaはMuse CodeとMeta Model APIを挙げています。OpenRouterにもmeta/muse-spark-1.3として掲載されていますが、利用可否はプロバイダー、アカウント、地域によって変わる可能性があります。
Muse Spark 1.3の料金はいくらですか?
OpenRouterの掲載料金は、入力100万トークンあたり$1.25、出力100万トークンあたり$4.25、キャッシュ読み取り100万トークンあたり$0.15、ウェブ検索1,000回あたり$2.50です。直接利用するプロバイダーが独自の料金表を示している場合を除き、ここでは引用元であるOpenRouterの料金として扱ってください。
Muse Spark 1.3のコンテキストウィンドウは100万トークンですか?
OpenRouterとModelCapは1,048,576トークンと掲載し、Artificial Analysisは100万トークンに丸めて表示しています。実際に呼び出すエンドポイントで、コンテキストと出力の上限を確認してください。
画像、動画、ツール、JSON出力に対応していますか?
OpenRouterでは、テキスト、画像、動画、ファイルの入力に加え、ツール呼び出しとJSON Schema形式の構造化出力に対応するとしています。音声も掲載されていますが、理解機能は完全にはサポートされていないという注意書きがあります。
Muse Spark 1.3はオープンソースですか?セルフホスティングできますか?
今回確認した情報からは、ダウンロード可能なウェイトやセルフホスティング用パッケージは確認できませんでした。Metaが説明しているのは、オープンウェイト化を将来のロードマップとすることであり、利用可能なMuse Spark 1.3の成果物ではありません。
max reasoningは利用できますか?
Metaは、既存の推論モードを先に提供し、max reasoningは追加の安全性テスト後に提供すると説明しています。発表では具体的な時期は示されていません。
Muse Spark 1.2のContributor料金を1.3にも適用できますか?
いいえ。1.2のContributor条件は別途文書化されていますが、今回確認した情報からは、1.3のContributor契約全体は確認できません。プロバイダーから異なるティア、データポリシー、レート制限が提示されるまでは、1.3の標準料金を前提にしてください。
本番導入前に、機密情報を含まない小規模なリポジトリベンチマークを実行しましょう。現在のモデルと同じタスクを比較し、初回トークンまでの時間、変更の完了数、ツール呼び出し回数、コストを記録します。導入すべきかどうかは、ローンチ当日の順位よりも、このテストのほうが確実に答えてくれます。