AIREITER

Claude Sonnet 5 vs Opus 4.8: Какой из них стоит использовать?

Последнее обновление: 2026-07-01 09:25:21

"Sonnet 5 is close to Opus 4.8, but cheaper" — это собственная подача Anthropic. Мы хотели понять, где это перестаёт быть правдой, поэтому прогнали четыре одинаковые задачи через обе модели посредством Claude Code CLI и зафиксировали реальную стоимость, длительность и количество вызовов инструментов из каждого ответа API. Самый важный момент: мы повысили Sonnet 5 до уровня xhigh effort, чтобы он соответствовал тому, что Opus 4.8 делает по умолчанию, и разница в цене, которую мы измерили, почти исчезла — при этом Opus 4.8 завершил работу примерно вдвое быстрее.

Sonnet 5 против Opus 4.8 вкратце

Claude Sonnet 5

Claude Opus 4.8

Выпуск

30 июня 2026

28 мая 2026

Окно контекста

1M токенов

1M токенов

Макс. вывод

128K токенов

128K токенов

Цены (вх./исх. за 1M токенов)

$2/$10 intro through Aug 31, 2026, then $3/$15

$5/$25

Быстрый режим

Не поддерживается

Поддерживается (предварительная исследовательская версия), до ~2.5x скорости вывода при премиальном ценообразовании

Уровни усилий

low / medium / high / xhigh / max

low / medium / high / xhigh / max

Позиционирование

Более дешёвая модель уровня Sonnet, ориентированная на agentic-задачи

Флагман Anthropic, вариант с наивысшей точностью

Окно контекста и максимальный вывод идентичны — здесь это не является отличительным фактором. А вот что является: Sonnet 5 работает на новом токенизаторе, который, по словам Anthropic, для того же текста выдает «примерно на 30% больше токенов», чем Sonnet 4.6, поэтому бюджет max_tokens или оценка стоимости, перенесенные из Sonnet 4.6, не будут напрямую сопоставимы.

Официальное сравнение бенчмарков

Согласно собственным раскрытиям Anthropic, собранным вместе с внешним анализом от llm-stats.com, картина последовательна: Sonnet 5 выигрывает или сравнивается в нескольких бенчмарках, а Opus 4.8 лидирует в большинстве остальных, обычно на однозначные величины.

Бенчмарк

Sonnet 5

Opus 4.8

Разрыв

Terminal-Bench 2.1

80.4%

74.6%

Sonnet 5 +5.8

Humanity's Last Exam (с инструментами)

57.4%

57.9%

Почти ничья

Humanity's Last Exam (без инструментов)

43.2%

49.8%

Opus +6.6

SWE-bench Verified

85.2%

88.6%

Opus +3.4

SWE-bench Pro

63.2%

69.2%

Opus +6.0

Toolathlon

54.3%

59.9%

Opus +5.6

OSWorld-Verified (computer use)

81.2%

83.4%

Opus +2.2

CursorBench

61.2%

63.8%

Opus +2.6

USAMO 2026 problems

79.5%

96.7%

Opus +17.2

Две вещи выделяются. Самое большое преимущество Opus 4.8 — в сложной математике (USAMO), а не в программировании — разрыв в программировании (SWE-bench, Terminal-Bench) везде составляет всего несколько пунктов, и Sonnet 5 на самом деле в одной из них одерживает полную победу. В общем рассуждении с использованием инструментов (HLE with tools) эти двое настолько близки, что это можно назвать ничьей.

Есть также показатель безопасности, на который стоит обратить внимание, хотя это и не бенчмарк возможностей: согласно тем же раскрытым данным, в сценариях browser-use без дополнительных мер защиты измеренная у Sonnet 5 успешность атак с prompt injection составила 0,93% против 31,5% у Opus 4.8. Anthropic не публиковала подробного объяснения этого конкретного разрыва. Если вы создаёте что-то агентное, что без присмотра просматривает открытый веб, стоит протестировать собственные меры защиты, а не предполагать, что флагманская модель автоматически является более безопасным выбором по умолчанию.

Мы сами провели четыре прямых сравнения

Большая часть того, что доступно сейчас, либо компилирует официальную таблицу бенчмарков выше, либо делится субъективными впечатлениями от одной модели. Мы не нашли контролируемого сравнения стоимости и задержки при одном и том же промпте, поэтому провели собственное.

Методология: четыре задачи, выполненные 2026-07-01, каждый раз один и тот же запрос отправлялся claude-sonnet-5 и claude-opus-4-8 через Claude Code CLI (claude -p --model <id> --effort <level> --output-format json). Стоимость, длительность и количество ходов считываются напрямую из API-ответа каждого запуска, а не оцениваются по количеству токенов. Каждая конфигурация модели/уровня effort была запущена по одному разу для каждой задачи — реальные числа из одного запуска, а не статистически усреднённая выборка. Размер каждого разрыва следует воспринимать как ориентировочный, а не точный; направление сохранялось одинаковым во всех тестах, которые мы провели.

Тест 1: Проверка обратимости затрат

Вопрос, на который мы больше всего хотели ответить: остаётся ли Sonnet 5 дешевле, если повысить уровень его усилий, чтобы компенсировать более сложную задачу? Мы выполнили ту же задачу кодирования, что и в Test 2 (ниже), на Sonnet 5 xhigh против Opus 4.8 medium.

Настройка

Стоимость

Длительность

Ходы

Результат

Sonnet 5, effort xhigh

$0.390

40.5s

7

8/8 tests pass

Opus 4.8, effort medium

$0.401

22.9s

4

7/7 tests pass

Разница в стоимости 3% — по сути, ничья — и Opus 4.8 на своем низком уровне усилий завершил задачу за 57% времени, используя почти вдвое меньше ходов. Оба сгенерировали правильный, рабочий код. Это совпадает с тем, на что уже указывают люди на Hacker News: один комментатор там оценил стоимость Opus 4.8 примерно в $0.45 на medium reasoning против Sonnet 5 примерно в $0.52 на xhigh/max для сопоставимой работы.

Terminal output showing the actual `claude -p` calls for the Sonnet 5 xhigh vs Opus 4.8 medium test, with the real duration_ms, num_turns, and total_cost_usd fields from each API response

Тест 2: Задача по программированию при сопоставимых усилиях

Тот же промпт, обе модели с усилием high : напишите эффективную функцию longest-palindromic-substring, сгенерируйте тестовые случаи, покрывающие крайние случаи, запустите их, исправьте всё, что не проходит.

Настройка

Стоимость

Длительность

Ходы

Результат

Sonnet 5 (high)

$0.378

37.4s

7

8/8 pass

Opus 4.8 (high)

$0.439

28.9s

5

8/8 pass

Оба пришли к одному и тому же подходу expand-around-center и прошли все тесты с первого раза. Opus 4.8 добрался до этого быстрее и за меньшее число шагов, примерно на 16% дороже. Когда качество идентично, в этом случае победа за Opus только за счёт скорости.

Тест 3: Письмо / Работа с информацией

Запрос на деловое решение без единственного правильного ответа: посоветуйте SaaS-компании из 12 человек, стоит ли потратить 3–4 недели на миграцию во второй регион AWS для аварийного восстановления за шесть недель до закрытия их раунда Series A.

Настройка

Стоимость

Длительность

Ходы

Sonnet 5 (high)

$0.072

14.7s

1

Opus 4.8 (high)

$0.084

22.7s

1

Оба дали по сути одинаковую рекомендацию — пропустить полную миграцию и вместо этого выпустить облегчённый резервный план/runbook — с сопоставимым качеством аргументации. Sonnet 5 пришёл к этому примерно за две трети времени и на 14% дешевле. Это единственный тест, где фраза «Sonnet 5 вполне справляется с интеллектуальной работой» проявилась особенно отчётливо.

Тест 4: Агентный поиск — действительно ли Sonnet 5 «переобдумывает»?

Некоторые треды на Reddit описывают Sonnet 5 как более склонный к чрезмерному усложнению простых запросов, чем Opus 4.8. Мы протестировали действительно простой: просуммировать размер байтов каждого файла .py в дереве каталогов и сообщить, в каком подкаталоге их больше всего.

Настройка

Стоимость

Длительность

Ходы

Sonnet 5 (high)

$0.119

18.5s

3

Opus 4.8 (high)

$0.120

12.1s

2

Оба пришли к одному и тому же правильному ответу. Стоимость отличалась на величину, укладывающуюся в погрешность округления, но Sonnet 5 потребовал на один дополнительный цикл вызова инструмента и примерно на 50% больше времени. Это действительно, пусть и не слишком большой, показатель в пользу жалобы на «переобдумывание» — и он согласуется с Тестом 1: Sonnet 5, как правило, делает больше шагов, чтобы прийти к тому же результату.

Так какой же из них вам действительно следует использовать?

  • Выбирайте Opus 4.8 для задач программирования, где важна скорость, агентных рабочих процессов с множеством вызовов инструментов или любых случаев, когда вы иначе могли бы соблазниться повысить effort Sonnet 5 выше high, чтобы доверять результату — именно в такой ситуации ценовое преимущество Sonnet 5 исчезает.

  • Выбирайте Sonnet 5 для больших объёмов работы, чувствительной к бюджету, и для общих задач на знания/письмо, но оставляйте его на уровне medium или high effort. Не повышайте его рефлекторно до xhigh «на всякий случай» — именно здесь история с ценой рушится.

  • Подходит любой вариант для простых поисковых запросов и одноходовых запросов; на практике мы измерили лишь один дополнительный ход и несколько секунд, а не неверный ответ.

FAQ

Действительно ли Claude Sonnet 5 дешевле, чем Opus 4.8?

При одинаковых уровнях усилий — да, заметно. Но если поднять Sonnet 5 до xhigh в качестве компенсации за более сложную задачу, разрыв может сократиться до нескольких процентов, в то время как Opus 4.8 на более низком уровне усилий завершит работу быстрее. Проверьте, какой уровень усилий у вас на самом деле используется, прежде чем считать, что вы экономите деньги. Полный прайс-лист по Haiku, Sonnet и Opus см. в нашем руководстве по ценам Claude API.

Как насчёт Claude Sonnet 5 по сравнению с Sonnet 4.6?

Поколенческое обновление, а не выбор между уровнями модели — и стоимость тоже не движется в том же направлении. Sonnet 5 опережает Sonnet 4.6 на двузначный процент в Terminal-Bench, но в наших собственных прямых тестах на стоимость Sonnet 5 оказался дороже, чем Sonnet 4.6, на каждом уровне effort, который мы попробовали, главным образом из-за нового tokenizer. Полные тесты и цифры в Sonnet 5 vs Sonnet 4.6: Is It Actually Cheaper?

Справедливо ли сравнивать Claude Sonnet 5 и Opus 4.6?

Не совсем — Opus 4.6 на одно поколение отстаёт от Opus 4.8. Если вы решаете, что использовать сегодня, сравнивайте с Opus 4.8, а не с его предшественником.

Отличается ли контекстное окно между ними?

Нет — оба предлагают контекстное окно на 1 млн токенов и максимальный объем вывода 128K.

Почему показатель prompt-инjection у Opus 4.8 значительно выше при использовании в браузере?

Согласно раскрытиям Anthropic, 31,5% без дополнительных мер защиты против 0,93% у Sonnet 5, в частности в сценариях использования браузера без надзора. Anthropic не публиковала подробного объяснения. Рассматривайте это как повод протестировать именно ваши конкретные меры защиты, а не предполагать, что флагманская модель автоматически является более безопасным вариантом по умолчанию.

Приложение: Точные промпты и необработанный вывод

Для тех, кто хочет воспроизвести это, вот точные подсказки, которые мы отправили для каждого теста (в Test 1 и Test 2 использовалась одна и та же подсказка для кодирования, только на разных уровнях усилий).

Тесты 1 & 2 — кодовый запрос:

Напишите функцию Python `longest_palindromic_substring(s: str) -> str`, которая возвращает
самую длинную палиндромную подстроку s, используя подход, более эффективный, чем
brute-force O(n^3) (например, расширение от центра или алгоритм Манакера). Сохраните её
в solution.py.

Затем напишите test_solution.py как минимум с 6 тестовыми случаями, покрывающими: пустую строку,
один символ, строку из одинаковых символов, отсутствие палиндрома длиннее 1, палиндром
чётной длины и палиндром нечётной длины.

Запустите тесты с pytest и убедитесь, что все они проходят. Если какие-либо не пройдут, исправьте
код и запускайте снова, пока все не пройдут. Сообщите итоговый вывод pytest.

Тест 3 — запрос для письма/умственной работы:

Вы консультируете небольшую SaaS-компанию (12 сотрудников, $80k MRR, сейчас работает в
одном регионе AWS) по вопросу, стоит ли расширяться во второй регион AWS для disaster
recovery до их раунда финансирования Series A, который закроется через 6 недель.
Engineering оценивает, что миграция займет 3–4 недели и будет использовать большую часть
возможностей команды в течение этого окна, задерживая две запрошенные клиентами
функции.

Напишите исполнительную рекомендацию примерно на 350 слов: следует ли им сделать это сейчас, отложить
или найти промежуточный вариант? Обоснуйте с учетом tradeoffs. Без вступления, только
рекомендация.

Тест 4 — prompt для agentic lookup:

В текущем дереве каталогов найдите все файлы с расширением .py, суммируйте их
общий размер в байтах и скажите мне, какой единственный подкаталог (непосредственный дочерний элемент
рабочего каталога) содержит больше всего файлов .py по количеству. Только два
числа/ответа, не нужно создавать какие-либо новые файлы.

Вот фактический ответ API для запуска Sonnet 5 (xhigh) из Test 1, сокращённый до полей, относящихся к стоимости и времени:

{
  "duration_ms": 40474,
  "num_turns": 7,
  "stop_reason": "end_turn",
  "total_cost_usd": 0.38962215,
  "usage": {
    "input_tokens": 4303,
    "cache_creation_input_tokens": 65277,
    "cache_read_input_tokens": 310598,
    "output_tokens": 2583
  }
}

Это неотредактированные total_cost_usd, duration_ms и количество токенов, которые Claude Code CLI вернул для этого запуска — числа в таблице Test 1 выше берутся напрямую из таких полей, по одному JSON-ответу на каждый запуск.