Claude Opus 5 vs GPT-5.6: сравниваем Sol, Terra и Luna

Последнее обновление: 2026-07-25 05:28:05

Какую модель подставить в агента, которого вы подключаете на этой неделе: claude-opus-5 или gpt-5.6? Второй вариант на самом деле не обозначает конкретную модель. Это алиас, который ведёт к одному из трёх SKU с разными тарифами.

Если коротко: до 272 000 входных токенов два флагмана различаются по цене максимум на 7%; после этого порога Claude Opus 5 обходится примерно вдвое дешевле GPT-5.6 Sol. 24 июля 2026 года мы запустили все четыре модели на одинаковых четырёх проверках и сверили каждый параметр с документацией обоих поставщиков.

Sol, Terra и Luna: три размера одного поколения

OpenAI выпустила все три модели 9 июля 2026 года. В справочнике они сопоставлены со старыми суффиксами размеров: Sol соответствует «уровню без суффикса в прежних семействах GPT-5», Terra — «уровню mini», Luna — «уровню nano». Это три SKU одного поколения, а не три разных поколения.

Строка gpt-5.6 без уточнения — алиас. В журнале изменений OpenAI она направляется на gpt-5.6-sol, поэтому конфигурация с именем gpt-5.6 будет тарифицироваться по верхней ставке семейства.

ВариантИдентификатор моделиКакому уровню соответствуетВвод / вывод за 1M (≤272K)Оценка рассуждений
Solgpt-5.6-sol (алиас gpt-5.6)без суффикса$5.00 / $30.00Максимальная
Terragpt-5.6-terramini$2.50 / $15.00Выше
Lunagpt-5.6-lunanano$1.00 / $6.00Высокая

Общее у моделей важнее различий. На всех трёх страницах указаны одинаковые параметры:

  • Контекстное окно — 1 050 000 токенов, максимальный вывод — 128 000
  • Срез знаний — 16 февраля 2026 года
  • На входе текст и изображения, на выходе текст; дообучение не поддерживается, датированных снимков нет
  • Одинаковая шкала effort и одинаковая оценка скорости «Fast»

Единственные документированные различия — цена и оценка рассуждений. Метка «Default» есть на странице каждой модели в рамках её собственного уровня, поэтому наличие такой метки у Terra не делает её моделью семейства по умолчанию.

На стороне Anthropic один SKU. Claude Opus 5 вышла 24 июля 2026 года как claude-opus-5: это закреплённый снимок без суффикса с датой. Цена составляет $5 за вход и $25 за выход на миллион токенов; окно в 1M токенов одновременно является стандартным и максимальным.

Кодинг: четыре механические проверки — четыре чистых прохода

Через один OpenAI-совместимый шлюз мы отправили четыре задачи с машинно проверяемыми условиями прохождения. Пользовательский промпт для всех моделей был одинаковым:

  • Исправление бага: починить kth_smallest, где вызов in-place sort() менял исходный список, а индекс содержал ошибку на единицу
  • Строгий JSON: фиксированный порядок ключей, согласованные count и checksum
  • Рассуждение: наибольшая недостижимая сумма при наличии только упаковок по 7 и 12 — число Фробениуса, 7×12−7−12 = 65
  • Рефакторинг: добавить валидацию, не меняя сигнатуру

Все четыре модели получили 4/4: использовали sorted() либо копию списка, перенесли индекс на k-1, вернули разбираемый JSON в нужном порядке ключей, число 65 и аккуратный рефакторинг. Это один запуск на каждую пару «модель — задача», а не бенчмарк: на таком масштабе корректность модели не разделила.

Более широкие заявления основаны на цифрах поставщиков и независимо не воспроизводились. В материалах к запуску Anthropic утверждает, что при максимальном effort Opus 5 отстаёт от пикового результата Fable 5 на CursorBench 3.2 менее чем на 0,5%, но стоит вдвое дешевле на задачу; это относительный результат, полученный самой компанией. Страница запуска GPT-5.6 у OpenAI возвращает 403 автоматическим запросам, поэтому оценки Sol в программировании остаются на совести тех, кто их публикует:

Сторонний бенчмаркSolTerraLuna
Vellum, Terminal-Bench 2.188.8%87.4%84.7%
Artificial Analysis, Coding Agent Index80 с Codex7775

Практические впечатления расходятся с таблицами результатов. Один разработчик, сравнивавший обе модели при High effort, 24 июля написал: «GPT 5.6 Sol High всё ещё лучше справляется с кодингом, чем Claude Opus 5 High».

В рекомендациях Anthropic по миграции есть деталь, которую стоит учесть: Opus 5 сама проверяет свою работу. Унаследованные промпты с дополнительным шагом верификации теперь заставляют её проверять результат чрезмерно, поэтому такой шаг лучше удалить.

Следование инструкциям: разница проявилась в формате ответа

Две проверки фактически тестировали соблюдение инструкций. В JSON-задаче требовался items в нижнем регистре и алфавитном порядке, checksum 14 и никаких дополнительных ключей. Рефакторинг требовал выбросить ValueError, но не писать ни комментариев, ни docstring — модели регулярно нарушают это условие, начиная объяснять собственную работу. Все четыре прошли обе проверки.

Форма ответа, однако, различалась. Sol и Luna оборачивали результат в LaTeX и возвращали \boxed{65}, тогда как Opus 5 и Terra выдавали простое число. Регулярное выражение, извлекающее последнее целое число, переживёт оба формата. Парсер, ожидающий только число или поле JSON, — нет. А именно настройки по умолчанию вы получите, если замените claude-opus-5 на gpt-5.6, ничего больше не меняя.

Расход токенов: 1 182 у Opus 5 против 464 у Sol

Разницу ниже, вероятнее всего, объясняют два конфигурационных значения по умолчанию, а не качество ответов. У Opus 5 thinking включён из коробки, а effort в API и Claude Code по умолчанию равен high; обычный запрос уже запускает рассуждение. У GPT-5.6 по умолчанию стоит medium.

Видимые токены завершения по четырём задачам и стоимость по официальным тарифам на вывод. По одному запросу для каждой пары, без повторов, с настройками по умолчанию:

МодельТокены выводаЗадача рефакторингаСтоимость только вывода
Claude Opus 51,182600 tok / 8.3s$0.0296
GPT-5.6 Sol464321 tok / 12.0s$0.0139
GPT-5.6 Terra737603 tok / 11.8s$0.0111
GPT-5.6 Luna612380 tok / 8.7s$0.0037

У этих цифр есть два существенных ограничения. Шлюз сообщил от 62 до 4 471 токена промпта для одинакового пользовательского промпта у GPT-моделей, в то время как у Claude показатель оставался в диапазоне от 592 до 640. То есть запросы на уровне передачи не были идентичны: сравнение входной стоимости не имеет смысла, а источник разрыва нельзя однозначно установить.

Кроме того, руководство OpenAI по рассуждениям не возвращает их краткие сводки, пока вы явно не включите эту опцию. Эти скрытые токены GPT-5.6 тарифицирует как вывод, поэтому стоимость трёх GPT-моделей в таблице занижает итоговый счёт. Сопоставимый здесь сигнал — корректность; токены и задержка дают лишь общее направление.

Столбчатая диаграмма общей задержки по четырём задачам для каждой модели: Opus 5 — 24,6 секунды, Opus 4.8 — 11,8, Sonnet 5 — 13,7, GPT-5.6 Terra — 22,7, Sol — 20,3, Luna — 18,4

На диаграмме также показаны Opus 4.8 и Sonnet 5 — базовые модели Anthropic из того же запуска. Opus 5 оказалась самой медленной из шести: 24,6 секунды на четыре задачи против 20,3 секунды у Sol, 22,7 у Terra и 18,4 у Luna. У Opus 4.8 thinking по умолчанию выключен, и она завершила тест за 11,8 секунды; это указывает на влияние конфигурации, а не возможностей модели.

Artificial Analysis, оценивавшая Opus 5 в день релиза, описала настройку effort как диапазон расхода токенов, более широкий, чем у моделей других лабораторий. Поэтому её стоимость настраивается сильнее, чем может показаться по одному тарифу.

Цена: порог 272K в долларах

Ценовую половину сравнения Claude Opus 5 и GPT-5.6 определяет одна опубликованная фраза. По базовому тарифу флагманы отличаются почти незаметно: Opus 5 стоит $5/$25 за миллион токенов, Sol — $5 за вход и $30 за выход. Значит, Opus 5 на 17% дешевле по выводу и стоит столько же по входу. Но это верно только до 272 000 входных токенов.

На страницах всех трёх моделей GPT-5.6 есть одинаковая строка: «Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request.» Повышенный тариф применяется ко всему запросу, а не только к токенам сверх порога. Стоит превысить 272K на один токен — и Sol выставит $10/$45 за весь вызов. Окно Opus 5 в 1M при этом от начала до конца остаётся на ставке $5/$25.

Документация OpenAI по тарифам для разработчиков с отдельными колонками короткого и длинного контекста: для gpt-5.6-sol указаны $5.00 за вход и $30.00 за выход, для gpt-5.6-terra — $2.50 и $15.00, для gpt-5.6-luna — $1.00 и $6.00 за миллион токенов

Возьмём один агентный запрос с 20 000 выходных токенов и меняющимся объёмом входа. Расчёт сделан по опубликованным тарифам OpenAI и стандартным тарифам Anthropic, актуальным на 25 июля 2026 года:

Входные токеныClaude Opus 5GPT-5.6 SolGPT-5.6 Terra
200,000$1.50$1.60$0.80
400,000$2.50$4.90$2.45
900,000$5.00$9.90$4.95

Ниже границы флагманы отличаются на 7%. Выше неё Sol стоит в 1,96 раза дороже Opus 5 при 400K входных токенов и в 1,98 раза — при 900K. Поэтому сто запросов формата 400K обойдутся в $250 против $490.

Линейный график стоимости одного запроса с 20 000 выходных токенов при росте входа до 900K: GPT-5.6 Sol идёт рядом с Claude Opus 5 до 272K, затем скачком достигает $3.90 на 300K и растёт до $9.90; Opus 5 равномерно доходит до $5.00, а GPT-5.6 Terra делает такой же скачок и далее идёт рядом с Opus 5 до $4.95

Особенно интересна Terra. После 272K она платит те же $5 за миллион входных токенов, что и Opus 5. Поэтому вся разница приходится на выход: $2,50 за миллион токенов, то есть пять центов для этого запроса с 20K выходных токенов — одинаково при 300K и 900K входа. Она масштабируется с выводом, а не с входом. Граница — это дискретный скачок в тарифной сетке, а не плавный наклон, который создаёт равномерная шкала графика.

Batch-тарифы, токенизаторы и площадка покупки

На сниженных тарифах соотношение для запроса на 400K сохраняется:

  • Anthropic Batch API: Opus 5 стоит $2.50/$12.50, а запрос обходится в $1.25
  • OpenAI Batch и Flex: скидка 50% от стандартного тарифа, поэтому ставка Sol для длинного контекста составляет $5/$22.50, или $2.45 за тот же вызов

Ставки за токен нельзя напрямую сопоставлять между поставщиками. В документации Anthropic по ценам сказано, что модели Claude начиная с 4.7, включая Opus 5, используют новый токенизатор. Для того же текста он создаёт примерно на 30% больше токенов, хотя соотношение зависит от содержания и языка. Документ объёмом 400 000 токенов GPT-5.6 будет содержать около 520 000 токенов для Opus 5: входная часть этой строки вырастет с $2.00 до $2.60. Это всё ещё ниже $4.00 у Sol, но перед окончательным выбором стоит токенизировать собственные промпты.

Имеет значение и то, где вы покупаете доступ. AIReiter перепродаёт Claude ниже прайс-листа: Opus 4.8 стоит $1.56/$7.76 за миллион токенов, примерно на 69% дешевле официальной цены. В каталоге максимум — Fable 5 и Opus 4.8, поэтому Opus 5 там пока недоступна. В собственной линейке Anthropic вопрос безубыточности — это Fable 5 за $10/$50 против Opus 5 за $5/$25.

Контекст: обе заявляют 1M, но фиксированная ставка только у одной

Окно Opus 5 составляет 1 000 000 токенов и одновременно является стандартным и максимальным: случайно выбрать вариант с меньшим контекстом нельзя. Все три версии GPT-5.6 заявляют 1 050 000 — на 5% больше. Максимальный вывод с обеих сторон равен 128 000 токенов, но есть одно исключение: в Anthropic Batch API бета-заголовок output-300k-2026-03-24 поднимает потолок Opus 5 до 300 000.

Sol примет промпт на 900K токенов, но начислит повышенный тариф за длинный контекст на весь запрос. В результате около 74% заявленного окна лежит выше дешёвой ставки. Способность работать на большой длине — отдельный вопрос: в обзоре Vellum Luna получает 41,3% на MRCR против 91,5% у Sol и 89,6% у Terra. Это причина не использовать nano-уровень для длинного контекста независимо от цены. У Opus 5 срез знаний также новее — май 2026 года; на страницах всех трёх GPT-5.6 указан 16 февраля 2026 года.

Управление рассуждениями: одна шкала и два регулятора

Для любого уровня effort Opus 5 не нужен бета-заголовок, а thinking включён по умолчанию. У его отключения есть жёсткое ограничение: thinking: {"type": "disabled"} принимается только при effort не выше high; при xhigh или max API возвращает 400. Anthropic отмечает это как критическое изменение по сравнению с предыдущими моделями.

НастройкаClaude Opus 5GPT-5.6
Шкала effortlowmediumhighxhighmaxnonelowmediumhighxhighmax
Effort по умолчаниюhigh в API и Claude Codemedium
Второй регуляторнетreasoning.mode: standard (по умолчанию) или pro
Отключение рассужденийнедоступно выше effort higheffort: none

В руководстве OpenAI по рассуждениям документированы только эти два значения режима. В API нет значения ultra, а механизм Pro mode не раскрывается. В журнале изменений от 9 июля среди нововведений семейства указаны сохранённые рассуждения, effort max и Pro mode.

Практическая разница такова: GPT-5.6 позволяет полностью отказаться от рассуждений в критичных к задержке вызовах, тогда как Opus 5 не позволяет этого выше high. Зато Opus 5 даёт более широкий динамический диапазон внутри режима рассуждений. Один разработчик, отслеживающий обе линейки, выбрал единую шкалу между поставщиками: Luna high, Sol medium, затем Opus medium, high и xhigh.

Доступность, лимиты и дообучение

Opus 5 доступна через Claude API, Amazon Bedrock под именем anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code и Claude Cowork; в Claude Max она стала новой моделью по умолчанию. Быстрый режим Anthropic с ценой $10/$50 и пропускной способностью примерно в 2,5 раза выше доступен только в Claude API.

Все три версии GPT-5.6 — продукты OpenAI API, и на бесплатном API-тарифе нет ни Sol, ни Terra. Документированные лимиты Sol растут с 500 RPM на Tier 1 до 15 000 на Tier 5; у Terra тот же потолок. Ни одна из трёх моделей не поддерживает дообучение и не предоставляет датированный снимок, поэтому закрепить версию означает использовать обычный ID и принимать обновления на месте.

Какую модель для чего выбирать

Сначала проверьте размер входа: это единственный параметр с опубликованной ценовой ступенью. Затем на итоговую сумму повлияют кеширование, возможность использовать batch и объём вывода.

До 272K флагманы достаточно близки по цене, чтобы решали второстепенные факторы. Выше этой границы экономика прайс-листа даёт Opus 5 преимущество перед Sol примерно в 2 раза. Но на всё семейство это преимущество не распространяется: Terra после порога стоит $2.45 против $2.50 у Opus 5 для того же запроса. Экономия на длинном контексте — это сравнение с Sol, а не с GPT-5.6 в целом.

  • Claude Opus 5: большие промпты, единая ставка по всему окну в 1M, знания до мая 2026 года либо инференс, который должен работать через Bedrock, Google Cloud или Foundry.
  • GPT-5.6 Terra: вариант по умолчанию для объёмных задач, поскольку он дешевле Opus 5 на обоих концах диапазона.
  • GPT-5.6 Sol: если вам необходимы режим pro или effort none. Его надбавка оправдана управляющими настройками, а не каким-либо преимуществом в корректности, которое мы смогли измерить.
  • GPT-5.6 Luna: неглубокие массовые задачи; для длинного контекста её лучше не использовать.

Выбор между Claude Opus 5 и GPT-5.6 сводится к решению для каждого диапазона входного размера, и оба поставщика открыто указывают, где проходит эта граница.

FAQ

Claude Opus 5 лучше GPT-5.6 для программирования?

В наших четырёх механических проверках Opus 5, Sol, Terra и Luna набрали по 4/4, поэтому на таком масштабе корректность их не различила. Разработчики, использовавшие обе модели на High effort, тоже расходятся во мнениях. С ценой ситуация яснее: при входе свыше 272K токенов Opus 5 стоит примерно вдвое дешевле Sol.

Чем отличаются GPT-5.6 Sol, Terra и Luna?

Ценой и качественной оценкой рассуждений. Документация OpenAI относит Sol к прежнему уровню без суффикса, Terra — к mini, Luna — к nano. До 272K входных токенов тарифы составляют $5/$30, $2.50/$15 и $1/$6 за миллион токенов соответственно. Контекстное окно, максимальный вывод, срез знаний, модальности и шкала effort у всех трёх одинаковые.

Что лучше: GPT или Claude?

Ответ зависит от критерия, и самый большой опубликованный разрыв лежит в области, которую не рекламирует ни один поставщик. benchlm.ai указывает долю галлюцинаций AA-Omniscience 35,9% у Claude Opus 4.8 против 88,8% у GPT-5.6 Sol, при этом Sol лидирует по математике, знаниям и агентным категориям. Это наиболее близкая опубликованная пара; данных по Opus 5 или Terra пока нет ни у одного агрегатора. Если цена неверного ответа выше цены пропущенного, этот порядок важнее любой оценки кодинга.

Стоит ли использовать GPT-5.6 Terra вместо Sol?

Для большинства массовых задач — да. Практики, распределяющие запросы по сложности на r/codex, сообщают о распределении примерно 75% задач на Terra, 15% на Luna и 10% на Sol. Artificial Analysis считает средний уровень доминируемым: какую-либо настройку Luna или Sol обычно можно подобрать с равной или меньшей стоимостью. Поэтому перед тем, как считать середину безопасным выбором, проверьте Terra против обеих соседних моделей.

Есть ли у GPT-5.6 режим рассуждений ultra?

API предоставляет reasoning.mode с двумя документированными значениями — standard и pro — а также reasoning.effort от none до max. Pro mode появился в журнале изменений от 9 июля 2026 года. Значения ultra нет ни в руководстве OpenAI по рассуждениям, ни на страницах моделей.

Читайте также