Claude Opus 5.5 High — не слух и не экспериментальная утечка, а выпущенная модель. Но формулировка «1 509 баллов и первое место в Text Arena» описывает конкретный результат на конкретную дату, а не вечную характеристику продукта. Вопрос при выборе куда практичнее: действительно ли её сильные стороны в долгих задачах по программированию и исследованию стоят постоянно включённого адаптивного мышления, более медленных ресурсоёмких запусков и миграции API, после которой некоторые старые запросы могут начать возвращать новые ошибки 400.
Что именно выпустила Anthropic
Anthropic представила Claude Opus 5.5 22 сентября 2026 года — это первая модель семейства Claude 5.5. В официальном анонсе говорится, что она доступна через Claude и API и предназначена для агентного программирования, работы с компьютером и интеллектуальных задач. Прямой идентификатор модели — claude-opus-5-5; стандартное контекстное окно составляет 1 миллион токенов, а стандартный максимальный объём ответа — 128 000 токенов.
| Факт | Claude Opus 5.5 | Чего это не доказывает |
|---|---|---|
| Дата релиза | 22 сентября 2026 года | Что у всех шлюзов одинаковые маршрут и цена |
| Идентификатор модели в API | claude-opus-5-5 | Что старые интеграции с Opus 5 заработают без изменений |
| Контекстное окно | 1 миллион токенов | Что заполнение всего окна улучшит любую задачу |
| Режим по умолчанию | Medium | Что Medium работает так же, как прежний режим по умолчанию у Opus 5 |
| Мышление | Адаптивное и всегда включено | Что задержка ответа будет предсказуемой |
В собственном анонсе Anthropic утверждает, что Opus 5.5 в большинстве задач работает на уровне Claude Fable 5.1 и обходится на 40% дешевле Opus 5 при типичной нагрузке. Это именно заявления производителя. Компания также предупреждает: по мере сближения результатов бенчмарки всё хуже отражают реальные различия между моделями.
Что на самом деле означает результат 1 509 в Text Arena
Text Arena объявила, что Claude Opus 5.5 High дебютировала на первом месте с 1 509 баллами — на 18 баллов выше Opus 5 High. Это убедительный сигнал текущих предпочтений пользователей в условиях Arena, но не универсальная проверка качества программирования, работы с инструментами или фактической точности.
Показатель может быстро меняться. Более поздние снимки трекеров показывали другие значения, подтверждая, что рейтинг Arena зависит от времени. В том же объявлении Opus 5.5 High оказалась на границе Парето при смешанной цене $16 за миллион токенов. Но для расчёта бюджета этот показатель не должен подменять официальный прайс-лист API.
Есть и дополнительная оговорка: один из пользователей, комментируя объявление Arena, отметил, что разрыв в 18 баллов меньше погрешности. Поэтому рейтинг стоит воспринимать как полезный ориентир для собственного тестирования, а не как доказательство превосходства Opus 5.5 High над любой моделью в любой задаче.
«1509 против 1491 — разрыв в 18 баллов, и, если честно, он меньше погрешности». — @Avery_Coree в ответ на объявление Text Arena (источник)
Что показывают тесты помимо лидерборда
В опубликованной Anthropic таблице для Opus 5.5 указаны 66,4% в Terminal-Bench 4.0, 54,4% в FrontierCode Main, 57,8% в CursorBench 4.0 и 1 846 Elo в GDPval-AA v2.1. Есть и менее впечатляющие результаты: GPT-6 Astra набрала 41,4% против 40,0% у Opus 5.5 в AutomationBench и 64,6% против 58,7% в Terminal-Bench-Science.
| Оценка | Opus 5.5 | Сравнение |
|---|---|---|
| Terminal-Bench 4.0 | 66,4% | Fable 5.1: 55,8%; GPT-6 Astra: 57,9% |
| FrontierCode Main | 54,4% | GPT-6 Astra: 53,3% |
| CursorBench 4.0 | 57,8% | Opus 5: 46,6% |
| GDPval-AA v2.1 | 1 846 Elo | Fable 5.1: 1 735; Opus 5: 1 708 |
| AutomationBench | 40,0% | GPT-6 Astra: 41,4% |
| Terminal-Bench-Science | 58,7% | GPT-6 Astra: 64,6% |
У этих цифр есть важный контекст. Большинство результатов Opus 5.5 Anthropic получила на максимальном уровне адаптивного усилия; для Terminal-Bench использовался режим xhigh, тогда как Astra тестировалась в режиме high. Заявленная стандартная ошибка Terminal-Bench для Opus 5.5 составляет ±2,6 пункта, поэтому близкие результаты нельзя превращать в точный рейтинг.
Независимые проверки в целом указывают в том же направлении, но добавляют полезные нюансы. В исследовании Sonar на Java Opus 5.5 High показала 87,68% успешных решений против 88,6% у Opus 5. При этом объём сгенерированного кода снизился с 916 813 до 664 890 строк, а общее число найденных проблем — с 18 814 до 10 941. Но плотность ошибок выросла с 576 до 644 на миллион строк, а число проблем, связанных с конкурентным выполнением, увеличилось. Это аргумент в пользу автоматических тестов, а не разрешение принимать сгенерированный код без проверки.
Для каких задач Claude Opus 5.5 High стоит протестировать
Лучший сценарий — длительная работа с инструментами, где грамотное планирование и меньшее число повторных попыток важнее мгновенного ответа. Anthropic сообщает, что аудит проекта на 200 000 строк был завершён менее чем за три часа против более чем 20 часов у Opus 5, а переписывание HAProxy с C на Rust заняло 9,5 часа против 12 часов у Fable 5.1. Это примеры самого производителя, поэтому воспринимать их лучше как гипотезы для пилота, а не как гарантии.
Реальные пользователи описывают похожую картину, но без единодушного восторга. Один пользователь Reddit рассказал, что примерно за четыре минуты пересобрал сайт и получил более удачный дизайн, тогда как другой написал, что Opus 5.5 «просто не останавливается» во время оркестрации. Качество текста тоже устраивает не всех: @rchitectopteryx назвал его «худшим бездумным текстом, который когда-либо видел». Практический вывод зависит от типа нагрузки: сначала тестируйте модель на многошаговом программировании, аудите репозиториев и исследовательских задачах с объективными критериями приёмки, а не только на текстах, качество которых оценивается по вкусу.
«Я заметил, что Opus 5.5 просто не останавливается. Даёшь ему задачу в оркестрации — и он просто.... продолжает работать». — @bridgerloftin (источник)
Цена, уровень усилий и стоимость ожидания
Официальные тарифы прямого API составляют $4 за миллион входных токенов, $20 за миллион выходных и $0.20 за миллион токенов, прочитанных из кеша. Запись в кеш стоит $5 за миллион токенов. Anthropic заявляет, что более низкие тарифы в сочетании с меньшим числом токенов на задачу дают в среднем 40% экономии по сравнению с Opus 5. На практике процент зависит от попаданий в кеш, уровня усилий, повторных запусков и использования инструментов.
| Позиция API | Opus 5.5 | Opus 5 |
|---|---|---|
| Вход / 1 млн токенов | $4 | $5 |
| Выход / 1 млн токенов | $20 | $25 |
| Чтение из кеша / 1 млн токенов | $0.20 | $0.50 |
| Запись в кеш на пять минут / 1 млн | $5 | $6.25 |
| Быстрый режим | $8 за вход / $40 за выход | — |
Более высокий уровень усилий не обязательно означает лучшую экономику. В независимом обзоре BitsMinds приведены данные Artificial Analysis о стоимости одной задачи: $1.34 в режиме medium, $1.82 в high, $3.46 в xhigh и $5.98 в max. Соответствующие результаты бенчмарка составили 51, 54, 56 и 58 баллов. Если задаче не требуется максимальное планирование, оптимальным режимом может оказаться high или medium.
Что проверить в API перед переходом
Claude Opus 5.5 — это не обновление, сводящееся к замене строки с именем модели. Рекомендации Anthropic по миграции и независимые обзоры выделяют четыре изменения, которые стоит проверить на стенде:
- Мышление нельзя отключить. Запросы с отключённым мышлением или заданным вручную бюджетом мышления могут завершаться ошибкой HTTP 400. Используйте адаптивное мышление и управляйте уровнем усилий.
- Изменился принудительный выбор инструмента. Значения
tool_choiceвродеanyили имени конкретного инструмента больше не принимаются; перестройте цикл вокруг поддерживаемого автоматического выбора и валидации. - Блоки мышления зависят от истории диалога. Сохраняйте возвращённые блоки мышления согласно требованиям и отдельно протестируйте изменения сообщений или истории вызовов инструментов.
- Изменилась обработка прогресса. Текст между вызовами инструментов может приходить внутри блоков мышления. Поэтому интерфейсам, которые показывают ход работы, нужно разбирать типы блоков, а не считать, что видимый текст всегда находится в первом элементе содержимого.
Проведите эти проверки со staging-ключом, прежде чем переводить на новую модель рабочий трафик. Старый маршрут лучше сохранить, пока вы не сравните успешность завершений, число повторных попыток, задержку, списанные токены и время, которое специалисты тратят на исправления.
Как провести практический пилот Opus 5.5 High
Вместо абстрактного запроса для проверки рейтинга возьмите ограниченный набор реальных задач:
- Выберите 20 уже решённых тикетов, аудитов или исследовательских материалов.
- Запустите Opus 5.5 в режимах medium и high с одинаковыми инструментами и критериями приёмки.
- Зафиксируйте долю завершённых задач, число повторных запусков, затраченное время, входные, выходные и кешированные токены, а также минуты работы проверяющего.
- Отдельно анализируйте ошибки в конкурентном выполнении, безопасности и фактической точности — не прячьте их в одну общую оценку.
- Сравнивайте стоимость одного принятого результата, а не стоимость одного запроса.
- Оставляйте режим max только для задач, где прирост качества оправдывает дополнительные ожидание и расход токенов.
Переход на новую модель оправдан, если Opus 5.5 снижает общую стоимость поставки результата или объём проверки в регулярно выполняемой работе. Одного места в Arena недостаточно.
Часто задаваемые вопросы о Claude Opus 5.5 High
Claude Opus 5.5 High уже официально выпущена?
Anthropic официально выпустила Claude Opus 5.5 22 сентября 2026 года. «High» — это конфигурация уровня усилий, используемая в оценках и инструментах; отдельного анонса самостоятельного продукта с независимым идентификатором модели не было.
1 509 — это по-прежнему текущий результат в Text Arena?
Не обязательно. 1 509 — показатель из объявления Arena от 26 сентября; более поздние трекеры показывали другие значения. При цитировании указывайте дату и источник.
Opus 5.5 High лучше Fable 5.1?
В нескольких опубликованных оценках она лидирует и дешевле за токен, но Anthropic подчёркивает, что разница в реальной работе уже, чем можно предположить по результатам бенчмарков. На конкретном репозитории, в определённом процессе или сложной многофайловой задаче Fable может оказаться сильнее, поэтому протестируйте обе модели на одинаковом наборе задач.
Сколько стоит Claude Opus 5.5?
Базовые тарифы прямого API — $4 за миллион входных токенов, $20 за миллион выходных, $0.20 за миллион токенов, прочитанных из кеша, и $5 за миллион пятиминутных записей в кеш. Цены шлюзов и расход подписочного доступа могут отличаться.
Стоит ли сразу включать максимальный уровень усилий?
Обычно нет. Начните с medium или high, измерьте качество принятых результатов и общую стоимость, а max оставьте для задач, которым действительно помогает более глубокое планирование. Максимальный уровень может улучшить результаты бенчмарков, но одновременно увеличить задержку и расход токенов.
Решение остаётся простым, даже если лидерборд постоянно меняется: выбирайте Claude Opus 5.5 High для проверенного долгого процесса, где более высокое качество завершения перевешивает ожидание и затраты на миграцию. Для коротких, чувствительных к задержке или требовательных к стилю задач сохраняйте более дешёвый или быстрый маршрут, пока собственный пилот не покажет однозначный выигрыш.