Claude Opus 5.5 Highは、噂段階のモデルではなく正式リリース済みの製品だ。ただし「1,509点でText Arena首位」という数字は、ある時点のランキング結果であって、永続的な製品仕様ではない。導入を検討するうえで本当に問うべきなのは、コーディングや調査のような長時間タスクで、常時有効なアダプティブ思考、時間のかかる高負荷実行、そして新たな400エラーが発生し得るAPI移行を受け入れる価値があるかどうかだ。
Anthropicが実際にリリースしたもの
AnthropicはClaude Opus 5.5を発表した。発表日はSeptember 22, 2026で、Claude 5.5ファミリーとしては初のモデルとなる。公式発表では、ClaudeとAPIの両方から利用でき、エージェント型コーディング、コンピューター操作、知識労働向けのモデルと位置づけられている。直接指定するモデルIDはclaude-opus-5-5。標準コンテキストウィンドウは1 million tokens、標準の最大出力は128,000 tokensだ。
| 事実 | Claude Opus 5.5 | この事実からは分からないこと |
|---|---|---|
| リリース日 | September 22, 2026 | すべてのゲートウェイで同じ経路や価格になること |
| APIモデルID | claude-opus-5-5 | 従来のOpus 5連携がそのまま互換すること |
| コンテキストウィンドウ | 1 million tokens | ウィンドウを埋めればどんなタスクでも性能が上がること |
| デフォルトの思考負荷 | Medium | mediumが従来のOpus 5のデフォルト動作と同じであること |
| 思考機能 | アダプティブで常時有効 | レイテンシーを予測しやすいこと |
Anthropicの発表によると、Opus 5.5は多くの作業でClaude Fable 5.1と同等の性能を発揮し、一般的なワークロードではOpus 5より実行コストが40%低いという。ただし、これはベンダーによる主張だ。同社自身も、ベンチマークの僅差は現実の性能差を判断する材料として、以前ほど信頼できなくなっていると注意を促している。
Text Arenaの1,509点をどう読むべきか
Text Arenaは、Claude Opus 5.5 Highが1,509点で初登場首位になったと発表した。Opus 5 Highを18点上回る結果だ。現在のArena環境でユーザーから高く評価されたことを示す有力な材料ではあるが、コーディング、ツール利用、事実性までを網羅的に測る万能テストではない。
しかも、この数字は短期間で動く。後続のトラッカーでは異なるスコアが示されており、Arenaの順位が時点依存であることが分かる。Arenaの発表では、Opus 5.5 Highはブレンド価格$16 per million tokensでPareto frontierにも位置づけられたが、ワークロードの予算を組む際は、このブレンド値ではなく公式API価格表を確認すべきだ。
不確実性を無視できない理由はもう一つある。Arenaの発表に対するユーザーの返信では、18点差は誤差範囲より小さいのではないかと指摘されていた。ランキングは試す価値のあるシグナルとして扱い、Opus 5.5 Highがあらゆるタスクで全モデルを上回る証拠だとは考えないほうがいい。
「1509対1491で18点差。でも正直、その差は誤差範囲より小さい」— @Avery_Coree、Text Arenaの発表への返信(source)
リーダーボード以外の根拠を見る
Anthropicが公開した表によれば、Opus 5.5はTerminal-Bench 4.0で66.4%、FrontierCode Mainで54.4%、CursorBench 4.0で57.8%、GDPval-AA v2.1で1,846 Eloを記録している。一方で弱点もある。AutomationBenchではGPT-6 Astraが41.4%で、Opus 5.5の40.0%を上回った。Terminal-Bench-Scienceでも、GPT-6 Astraの64.6%に対してOpus 5.5は58.7%だった。
| 評価 | Opus 5.5 | 注目すべき比較対象 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | Fable 5.1:55.8%、GPT-6 Astra:57.9% |
| FrontierCode Main | 54.4% | GPT-6 Astra:53.3% |
| CursorBench 4.0 | 57.8% | Opus 5:46.6% |
| GDPval-AA v2.1 | 1,846 Elo | Fable 5.1:1,735、Opus 5:1,708 |
| AutomationBench | 40.0% | GPT-6 Astra:41.4% |
| Terminal-Bench-Science | 58.7% | GPT-6 Astra:64.6% |
これらの数字は、測定条件とセットで読む必要がある。AnthropicによるOpus 5.5の結果の大半は、アダプティブ思考負荷を最大にして測定されたものだ。Terminal-BenchではOpus 5.5にxhigh、Astraにhighが使われている。また、Terminal-Benchで示されたOpus 5.5の標準誤差は±2.6ポイント。スコアが近いモデルを、厳密な順位として扱うべきではない。
独立した評価もおおむね同じ方向を示しているが、実運用上の注意点も浮かび上がる。SonarのJava評価では、Opus 5.5 Highの合格率は87.68%で、Opus 5の88.6%を下回った。一方、生成コードは916,813行から664,890行に減り、検出された問題の総数も18,814件から10,941件に減少している。同じテストでは、100万行あたりのバグ密度が576件から644件に増え、並行性に関する問題も増加した。これは自動テストを工程に組み込むべき理由であり、生成コードをレビューなしで受け入れてよい理由ではない。
Claude Opus 5.5 Highを試す価値がある領域
最も相性がよいのは、即答の速さよりも、計画を立ててツールを使い、やり直しを減らすことが重要な長時間タスクだ。Anthropicによれば、200,000行の監査を3時間未満で完了した。Opus 5では20時間超かかった作業だ。また、HAProxyのCからRustへの書き換えは9.5時間で完了し、Fable 5.1の12時間を下回った。いずれもAnthropicによる事例なので、確約ではなく、パイロットで検証する仮説として受け止めたい。
実際のユーザーからも似た傾向は報告されているが、評価は一様ではない。あるRedditユーザーは、デザインも改善されたウェブサイトを約4分で作り直せたと報告している。一方で、別のユーザーはオーケストレーション中のOpus 5.5について「とにかく止まらない」と書いている。文章品質が常に向上するわけでもない。@rchitectopteryxは、文章として「これまで見た中で最悪のスロップ」と評した。したがって、実用上の結論はワークロード次第だ。まずは多段階のコーディング、リポジトリ監査、客観的な受け入れ基準を設定できる調査タスクで試し、好みの影響が大きいコピーライティングだけで判断するのは避けたい。
「Opus 5.5で気づいたのは、とにかく止まらないこと。オーケストレーションでタスクを渡すと、そのまま……走り続ける」— @bridgerloftin(source)
価格、思考負荷、待ち時間のコスト
公式の直接API料金は、入力が$4 per million tokens、出力が$20 per million tokens、キャッシュ読み取りが$0.20 per million tokens。キャッシュ書き込みは$5 per million tokensだ。Anthropicは、料金の引き下げとタスクあたりの使用トークン削減により、Opus 5に対して通常40%のコスト削減になるとしている。ただし、この割合はキャッシュヒット率、思考負荷、リトライ、ツール利用によって変動する。
| API項目 | Opus 5.5 | Opus 5 |
|---|---|---|
| 入力 / 1M tokens | $4 | $5 |
| 出力 / 1M tokens | $20 | $25 |
| キャッシュ読み取り / 1M tokens | $0.20 | $0.50 |
| 5分間キャッシュ書き込み / 1M | $5 | $6.25 |
| Fast mode | $8 input / $40 output | — |
思考負荷を上げれば、必ず費用対効果が高まるわけではない。BitsMindsの独立レビューでは、Artificial Analysisのタスク単価として、mediumは$1.34、highは$1.82、xhighは$3.46、maxは$5.98と報告されている。ベンチマークスコアはそれぞれ51、54、56、58だった。最大限の計画性が不要なタスクなら、highまたはmediumのほうが運用上の最適解になり得る。
切り替え前に確認したいAPI移行ポイント
Claude Opus 5.5への移行は、モデル名を書き換えるだけでは終わらない。Anthropicの移行ガイダンスと独立レビューでは、少なくとも次の4点をステージング環境で確認すべきだとされている。
- 思考機能を無効化できない。 思考機能をdisabledにしたリクエストや、手動の思考予算を指定したリクエストは、HTTP 400で失敗する場合がある。アダプティブ思考を使い、思考負荷で制御する。
- 強制的なツール選択の仕様が変わった。
anyや特定のツール名など、tool_choiceの値は受け付けられなくなった。サポートされる自動選択と検証を前提に、ループ処理を組み直す必要がある。 - 思考ブロックは会話履歴に依存する。 必要に応じて返却された思考ブロックを保持し、メッセージやツール履歴を編集した場合の挙動もテストする。
- 進捗表示の扱いが変わった。 ツール呼び出しの間にあるテキストが思考ブロックとして届く場合がある。進捗を表示するUIでは、常に最初のコンテンツ項目に表示テキストが入っていると決めつけず、ブロックの種類を解析しなければならない。
本番トラフィックを移す前に、ステージング用のキーでこれらを確認しておこう。成功した完了処理、リトライ、レイテンシー、課金対象トークン、人による修正時間を比較できるまで、従来の経路も残しておくべきだ。
Claude Opus 5.5 Highを試す現実的な方法
ランキング用のプロンプトではなく、範囲を限定した実タスクで試す。
- 過去に解決済みのチケット、監査、調査成果物を20件選ぶ。
- 同じツールと受け入れテストを使い、Opus 5.5をmediumとhighで実行する。
- 完了率、リトライ回数、経過時間、入力・出力・キャッシュトークン、レビュー時間を記録する。
- 並行性、セキュリティ、事実性の問題はそれぞれ分けて確認し、単一のスコアに埋め込まない。
- リクエスト単価ではなく、受け入れ可能な成果物1件あたりのコストを比較する。
- maxは、品質向上分が追加の待ち時間とトークン消費に見合うタスクだけで使う。
定常的な業務で総配信コストやレビュー負担を下げられるなら、モデル切り替えには意味がある。Arenaの順位だけでは、判断材料として不十分だ。
Claude Opus 5.5 High FAQ
Claude Opus 5.5 Highは正式リリースされていますか?
Claude Opus 5.5は、AnthropicからSeptember 22, 2026に正式リリースされた。「High」は評価やツールで使われる思考負荷の設定であり、独立したモデルIDを持つ別製品として発表されたものではない。
Text Arenaの1,509点は現在も有効ですか?
必ずしもそうとは限らない。1,509点はSeptember 26のArena発表時点のスコアで、その後のトラッカーでは異なるスナップショットが示されている。数字を引用するときは、日付と出典を必ず併記したい。
Opus 5.5 HighはFable 5.1より優れていますか?
公開されている複数の評価では優位に立ち、トークン単価も安い。ただしAnthropicは、現実の性能差はベンチマークスコアほど大きくないとしている。特定のリポジトリ、ワークフロー、複雑な複数ファイルのタスクではFableが勝つ可能性もあるため、両方を同じパイロットで比較するのが確実だ。
Claude Opus 5.5の料金はいくらですか?
直接APIの基本料金は、入力が$4 per million tokens、出力が$20 per million tokens、キャッシュ読み取りが$0.20 per million tokens、5分間のキャッシュ書き込みが$5 per million tokens。ゲートウェイの料金やサブスクリプションでの利用量は異なる場合がある。
最大の思考負荷を使うべきですか?
通常は必要ない。まずmediumまたはhighから始め、受け入れ可能なタスクの品質と総コストを測定しよう。maxは、より深い計画性が成果につながる作業に限定したい。最大負荷でベンチマークスコアが上がっても、レイテンシーとトークン消費は増える可能性がある。
ランキングが複雑でも、判断の軸はシンプルだ。待ち時間と移行作業を上回る完了品質が得られる、測定可能な長時間ワークフローならClaude Opus 5.5 Highを選ぶ価値がある。一方、短時間で終わるタスク、レイテンシー重視の処理、スタイルへの依存度が高い作業では、自分たちのパイロットで明確な改善が確認できるまで、より安価または高速な経路を残しておこう。