AIREITER

Большой обзор Claude Opus 5.5 High: стоит ли выбирать лидера Arena?

Последнее обновление: 2026-09-27 00:36:33

Claude Opus 5.5 High — не слух и не экспериментальная утечка, а выпущенная модель. Но формулировка «1 509 баллов и первое место в Text Arena» описывает конкретный результат на конкретную дату, а не вечную характеристику продукта. Вопрос при выборе куда практичнее: действительно ли её сильные стороны в долгих задачах по программированию и исследованию стоят постоянно включённого адаптивного мышления, более медленных ресурсоёмких запусков и миграции API, после которой некоторые старые запросы могут начать возвращать новые ошибки 400.

Что именно выпустила Anthropic

Anthropic представила Claude Opus 5.5 22 сентября 2026 года — это первая модель семейства Claude 5.5. В официальном анонсе говорится, что она доступна через Claude и API и предназначена для агентного программирования, работы с компьютером и интеллектуальных задач. Прямой идентификатор модели — claude-opus-5-5; стандартное контекстное окно составляет 1 миллион токенов, а стандартный максимальный объём ответа — 128 000 токенов.

ФактClaude Opus 5.5Чего это не доказывает
Дата релиза22 сентября 2026 годаЧто у всех шлюзов одинаковые маршрут и цена
Идентификатор модели в APIclaude-opus-5-5Что старые интеграции с Opus 5 заработают без изменений
Контекстное окно1 миллион токеновЧто заполнение всего окна улучшит любую задачу
Режим по умолчаниюMediumЧто Medium работает так же, как прежний режим по умолчанию у Opus 5
МышлениеАдаптивное и всегда включеноЧто задержка ответа будет предсказуемой

В собственном анонсе Anthropic утверждает, что Opus 5.5 в большинстве задач работает на уровне Claude Fable 5.1 и обходится на 40% дешевле Opus 5 при типичной нагрузке. Это именно заявления производителя. Компания также предупреждает: по мере сближения результатов бенчмарки всё хуже отражают реальные различия между моделями.

Что на самом деле означает результат 1 509 в Text Arena

Text Arena объявила, что Claude Opus 5.5 High дебютировала на первом месте с 1 509 баллами — на 18 баллов выше Opus 5 High. Это убедительный сигнал текущих предпочтений пользователей в условиях Arena, но не универсальная проверка качества программирования, работы с инструментами или фактической точности.

Показатель может быстро меняться. Более поздние снимки трекеров показывали другие значения, подтверждая, что рейтинг Arena зависит от времени. В том же объявлении Opus 5.5 High оказалась на границе Парето при смешанной цене $16 за миллион токенов. Но для расчёта бюджета этот показатель не должен подменять официальный прайс-лист API.

Есть и дополнительная оговорка: один из пользователей, комментируя объявление Arena, отметил, что разрыв в 18 баллов меньше погрешности. Поэтому рейтинг стоит воспринимать как полезный ориентир для собственного тестирования, а не как доказательство превосходства Opus 5.5 High над любой моделью в любой задаче.

«1509 против 1491 — разрыв в 18 баллов, и, если честно, он меньше погрешности». — @Avery_Coree в ответ на объявление Text Arena (источник)

Что показывают тесты помимо лидерборда

В опубликованной Anthropic таблице для Opus 5.5 указаны 66,4% в Terminal-Bench 4.0, 54,4% в FrontierCode Main, 57,8% в CursorBench 4.0 и 1 846 Elo в GDPval-AA v2.1. Есть и менее впечатляющие результаты: GPT-6 Astra набрала 41,4% против 40,0% у Opus 5.5 в AutomationBench и 64,6% против 58,7% в Terminal-Bench-Science.

ОценкаOpus 5.5Сравнение
Terminal-Bench 4.066,4%Fable 5.1: 55,8%; GPT-6 Astra: 57,9%
FrontierCode Main54,4%GPT-6 Astra: 53,3%
CursorBench 4.057,8%Opus 5: 46,6%
GDPval-AA v2.11 846 EloFable 5.1: 1 735; Opus 5: 1 708
AutomationBench40,0%GPT-6 Astra: 41,4%
Terminal-Bench-Science58,7%GPT-6 Astra: 64,6%

У этих цифр есть важный контекст. Большинство результатов Opus 5.5 Anthropic получила на максимальном уровне адаптивного усилия; для Terminal-Bench использовался режим xhigh, тогда как Astra тестировалась в режиме high. Заявленная стандартная ошибка Terminal-Bench для Opus 5.5 составляет ±2,6 пункта, поэтому близкие результаты нельзя превращать в точный рейтинг.

Независимые проверки в целом указывают в том же направлении, но добавляют полезные нюансы. В исследовании Sonar на Java Opus 5.5 High показала 87,68% успешных решений против 88,6% у Opus 5. При этом объём сгенерированного кода снизился с 916 813 до 664 890 строк, а общее число найденных проблем — с 18 814 до 10 941. Но плотность ошибок выросла с 576 до 644 на миллион строк, а число проблем, связанных с конкурентным выполнением, увеличилось. Это аргумент в пользу автоматических тестов, а не разрешение принимать сгенерированный код без проверки.

Для каких задач Claude Opus 5.5 High стоит протестировать

Лучший сценарий — длительная работа с инструментами, где грамотное планирование и меньшее число повторных попыток важнее мгновенного ответа. Anthropic сообщает, что аудит проекта на 200 000 строк был завершён менее чем за три часа против более чем 20 часов у Opus 5, а переписывание HAProxy с C на Rust заняло 9,5 часа против 12 часов у Fable 5.1. Это примеры самого производителя, поэтому воспринимать их лучше как гипотезы для пилота, а не как гарантии.

Реальные пользователи описывают похожую картину, но без единодушного восторга. Один пользователь Reddit рассказал, что примерно за четыре минуты пересобрал сайт и получил более удачный дизайн, тогда как другой написал, что Opus 5.5 «просто не останавливается» во время оркестрации. Качество текста тоже устраивает не всех: @rchitectopteryx назвал его «худшим бездумным текстом, который когда-либо видел». Практический вывод зависит от типа нагрузки: сначала тестируйте модель на многошаговом программировании, аудите репозиториев и исследовательских задачах с объективными критериями приёмки, а не только на текстах, качество которых оценивается по вкусу.

«Я заметил, что Opus 5.5 просто не останавливается. Даёшь ему задачу в оркестрации — и он просто.... продолжает работать». — @bridgerloftin (источник)

Цена, уровень усилий и стоимость ожидания

Официальные тарифы прямого API составляют $4 за миллион входных токенов, $20 за миллион выходных и $0.20 за миллион токенов, прочитанных из кеша. Запись в кеш стоит $5 за миллион токенов. Anthropic заявляет, что более низкие тарифы в сочетании с меньшим числом токенов на задачу дают в среднем 40% экономии по сравнению с Opus 5. На практике процент зависит от попаданий в кеш, уровня усилий, повторных запусков и использования инструментов.

Позиция APIOpus 5.5Opus 5
Вход / 1 млн токенов$4$5
Выход / 1 млн токенов$20$25
Чтение из кеша / 1 млн токенов$0.20$0.50
Запись в кеш на пять минут / 1 млн$5$6.25
Быстрый режим$8 за вход / $40 за выход—

Более высокий уровень усилий не обязательно означает лучшую экономику. В независимом обзоре BitsMinds приведены данные Artificial Analysis о стоимости одной задачи: $1.34 в режиме medium, $1.82 в high, $3.46 в xhigh и $5.98 в max. Соответствующие результаты бенчмарка составили 51, 54, 56 и 58 баллов. Если задаче не требуется максимальное планирование, оптимальным режимом может оказаться high или medium.

Что проверить в API перед переходом

Claude Opus 5.5 — это не обновление, сводящееся к замене строки с именем модели. Рекомендации Anthropic по миграции и независимые обзоры выделяют четыре изменения, которые стоит проверить на стенде:

  1. Мышление нельзя отключить. Запросы с отключённым мышлением или заданным вручную бюджетом мышления могут завершаться ошибкой HTTP 400. Используйте адаптивное мышление и управляйте уровнем усилий.
  2. Изменился принудительный выбор инструмента. Значения tool_choice вроде any или имени конкретного инструмента больше не принимаются; перестройте цикл вокруг поддерживаемого автоматического выбора и валидации.
  3. Блоки мышления зависят от истории диалога. Сохраняйте возвращённые блоки мышления согласно требованиям и отдельно протестируйте изменения сообщений или истории вызовов инструментов.
  4. Изменилась обработка прогресса. Текст между вызовами инструментов может приходить внутри блоков мышления. Поэтому интерфейсам, которые показывают ход работы, нужно разбирать типы блоков, а не считать, что видимый текст всегда находится в первом элементе содержимого.

Проведите эти проверки со staging-ключом, прежде чем переводить на новую модель рабочий трафик. Старый маршрут лучше сохранить, пока вы не сравните успешность завершений, число повторных попыток, задержку, списанные токены и время, которое специалисты тратят на исправления.

Как провести практический пилот Opus 5.5 High

Вместо абстрактного запроса для проверки рейтинга возьмите ограниченный набор реальных задач:

  1. Выберите 20 уже решённых тикетов, аудитов или исследовательских материалов.
  2. Запустите Opus 5.5 в режимах medium и high с одинаковыми инструментами и критериями приёмки.
  3. Зафиксируйте долю завершённых задач, число повторных запусков, затраченное время, входные, выходные и кешированные токены, а также минуты работы проверяющего.
  4. Отдельно анализируйте ошибки в конкурентном выполнении, безопасности и фактической точности — не прячьте их в одну общую оценку.
  5. Сравнивайте стоимость одного принятого результата, а не стоимость одного запроса.
  6. Оставляйте режим max только для задач, где прирост качества оправдывает дополнительные ожидание и расход токенов.

Переход на новую модель оправдан, если Opus 5.5 снижает общую стоимость поставки результата или объём проверки в регулярно выполняемой работе. Одного места в Arena недостаточно.

Часто задаваемые вопросы о Claude Opus 5.5 High

Claude Opus 5.5 High уже официально выпущена?

Anthropic официально выпустила Claude Opus 5.5 22 сентября 2026 года. «High» — это конфигурация уровня усилий, используемая в оценках и инструментах; отдельного анонса самостоятельного продукта с независимым идентификатором модели не было.

1 509 — это по-прежнему текущий результат в Text Arena?

Не обязательно. 1 509 — показатель из объявления Arena от 26 сентября; более поздние трекеры показывали другие значения. При цитировании указывайте дату и источник.

Opus 5.5 High лучше Fable 5.1?

В нескольких опубликованных оценках она лидирует и дешевле за токен, но Anthropic подчёркивает, что разница в реальной работе уже, чем можно предположить по результатам бенчмарков. На конкретном репозитории, в определённом процессе или сложной многофайловой задаче Fable может оказаться сильнее, поэтому протестируйте обе модели на одинаковом наборе задач.

Сколько стоит Claude Opus 5.5?

Базовые тарифы прямого API — $4 за миллион входных токенов, $20 за миллион выходных, $0.20 за миллион токенов, прочитанных из кеша, и $5 за миллион пятиминутных записей в кеш. Цены шлюзов и расход подписочного доступа могут отличаться.

Стоит ли сразу включать максимальный уровень усилий?

Обычно нет. Начните с medium или high, измерьте качество принятых результатов и общую стоимость, а max оставьте для задач, которым действительно помогает более глубокое планирование. Максимальный уровень может улучшить результаты бенчмарков, но одновременно увеличить задержку и расход токенов.

Решение остаётся простым, даже если лидерборд постоянно меняется: выбирайте Claude Opus 5.5 High для проверенного долгого процесса, где более высокое качество завершения перевешивает ожидание и затраты на миграцию. Для коротких, чувствительных к задержке или требовательных к стилю задач сохраняйте более дешёвый или быстрый маршрут, пока собственный пилот не покажет однозначный выигрыш.