AIREITER

Расход токенов GPT-5.6 Sol: почему он в 2,25 раза дороже GPT-5.5

Последнее обновление: 2026-08-05 19:04:16

В 1 715 сессиях Codex GPT-5.6 Sol в среднем расходовал 16,45 млн токенов на сессию — это в 2,25 раза больше, чем 7,30 млн токенов у GPT-5.5 за сопоставимый период из 1 667 сессий. Тариф за токен одинаковый, а расход — более чем вдвое выше. Вдобавок у Sol, судя по всему, есть задокументированная ошибка в Responses API, из-за которой оплачиваемый показатель output_tokens может завышаться в 6 раз и более. Если счёт за GPT-5.6 кажется вам неверным, скорее всего, так и есть.

Сколько токенов в действительности тратит GPT-5.6 Sol

Разработчик Vincent Schmalbach отследил расход токенов в двух 14-дневных периодах использования Codex. Он сравнил GPT-5.5 xhigh и GPT-5.6 Sol xhigh при почти одинаковом числе сессий:

ПоказательGPT-5.5 xhighGPT-5.6 Sol xhigh
Сессии1,6671,715
Всего токенов12.17B28.22B
Токенов на сессию7.30M16.45M

Число сессий выросло на 2,9%, а токенов на сессию — на 125%. При примерно том же объёме работы суммарный расход увеличился с 12,17 млрд до 28,22 млрд токенов, то есть в 2,32 раза.

Сравнение числа токенов на сессию у GPT-5.5 и GPT-5.6 Sol

На странице тарифов OpenAI для GPT-5.6 Sol указаны $5 за 1 млн входных и $30 за 1 млн выходных токенов — ровно столько же, сколько для GPT-5.5. При одинаковой ставке расход в 2,25 раза выше означает примерно в 2,25 раза большую стоимость задачи. Кроме того, в GPT-5.6 Sol появилась доплата за запись в кэш: 1,25 от ставки за входные токены. У GPT-5.5 такой комиссии не было.

«GPT 5.6 Sol — настоящая печь для сжигания токенов. Даже Sol на medium или high словно пожирает их. 5.6 стоит использовать только для сложного планирования или каверзных багов». — пользователь r/codex

Три подписки Schmalbach, которых раньше хватало на неделю интенсивной работы, теперь заканчиваются примерно за один день работы со средней нагрузкой.

Откуда у Sol такой расход

По эффективности на единицу результата бенчмарков Sol превосходит конкурентов. В Artificial Analysis Coding Agent Index ему нужно меньше выходных токенов, чем Claude Fable 5, чтобы набрать сопоставимый балл. Но в реальных сессиях Sol рассуждает активнее: строит планы, возвращается назад, проверяет себя и перебирает альтернативы. Цена этого подхода — больше токенов на задачу, хотя каждый из них выполняет больше полезной работы.

Заявленная ошибка биллинга, завышающая выходные токены

Помимо повышенного фактического расхода, есть задокументированная ошибка учёта в Responses API. Вероятно, она завышает поле output_tokens, именно по которому рассчитывается оплата. OpenAI расследует проблему, но публично не подтверждала её первопричину.

Один разработчик описал проблему на 710 вызовах GPT-5.6 и 22 922 вызовах reasoning в сумме. GPT-5.6 — первое семейство моделей, которое выдаёт несколько элементов reasoning в одном ответе: медиана k=9 для Sol и k=4 для Terra. Во время генерации накопитель API добавляет текущую сумму reasoning для каждого такого элемента, а затем к ней прибавляется и корректный итоговый счётчик.

Формула выглядит так:

output_tokens ≈ R × (k + 3) / 2

Здесь R — фактическое число токенов reasoning, а k — число элементов reasoning. Для Sol с медианой k=9 оплачиваемый счётчик завышается примерно в 6 раз. Для Terra при k=4 — примерно в 3,6 раза.

Как это выглядит в счёте

Самый показательный задокументированный случай: один вызов GPT-5.6 Terra вернул ответ из четырёх символов — d1d4, — но в счёт попали 466 818 выходных токенов при всего 21 064 фактических токенах reasoning.

Что сообщило APIЗначение
output_tokens (выставлено к оплате)466,818
reasoning_tokens (фактически)21,064
Видимый ответd1d4 (4 символа)
Элементы reasoning (k)41

При k=41 формула даёт R × (41+3)/2 = 21,064 × 22 = 463,408 — расхождение с выставленной суммой составляет менее 0,7%. Автор сообщения сверил это с панелью биллинга: сумма output_tokens из API, умноженная на опубликованные тарифы, воспроизводила списания в панели с точностью до одной десятой цента. По всем его вызовам GPT-5.6 из примерно $320 начислений около $284 были переплатой.

Ошибка появилась ещё до GPT-5.6

При k=1 — один элемент reasoning, который выдают модели до 5.6, — формула сводится к R × 4/2 = 2R. То есть получается постоянная переплата в 2 раза. Автор отчёта подтвердил это по собственному экспорту использования OpenAI за май 2026 года:

МодельОплаченные выходные токеныФактическое числоСоотношение
o3-mini25,408,97312,376,1322.02x
gpt-5.4-nano11,718,6105,844,1402.00x
o1778,989335,9442.01x
o4-mini (контроль)12,054,6809,160,5671.01x

GPT-5.6 не создал эту ошибку — он первым начал дробить reasoning на множество элементов, из-за чего незаметный множитель 2x превратился в гораздо более серьёзный. Причина в том, что reasoning передаётся блоками примерно по 512 токенов, поэтому k ≈ ceil(R/512). Подстановка в формулу даёт output_tokens ≈ R²/1024 + 3R/2. Иными словами, переплата растёт квадратично относительно длины рассуждения: вдвое больше размышлений — примерно вчетверо больше счёт.

На момент публикации этого материала, в августе 2026 года, сотрудники OpenAI ответили на сообщение об ошибке и запросили дополнительные данные. Однако ни исправление, ни корректировка счетов публично пока не подтверждены.

Тарифы GPT-5.6 после снижения цен 30 июля

30 июля 2026 года OpenAI снизила цену Luna на 80%, а Terra — на 20%. Тарифы Sol не изменились. Актуальные цены со страницы тарифов OpenAI:

МодельВход (короткий)Кэшированный входЗапись в кэшВыход (короткий)Выход (длинный)
GPT-5.6 Sol$5.00$0.50$6.25$30.00$45.00
GPT-5.6 Terra$2.00$0.20$2.50$12.00$18.00
GPT-5.6 Luna$0.20$0.02$0.25$1.20$1.80
GPT-5.5$5.00$0.50—$30.00$45.00
Сравнение тарифов на выходные токены моделей семейства GPT-5.6

Sol стоит столько же за токен, сколько GPT-5.5, но расходует в 2,25 раза больше токенов на задачу. Поэтому фактическая цена задачи примерно удваивается.

Запись в кэш стала отдельной статьёй расходов. GPT-5.6 берёт за неё 1,25 от ставки входных токенов: $6.25 за 1 млн для Sol. У GPT-5.5 такой платы не было. Если в вашей нагрузке мало попаданий в кэш, к входным расходам добавится наценка 25%, которой раньше не существовало.

Luna теперь дешевле GPT-5.4 nano. При $0.20/$1.20 против $0.20/$1.25 у nano Luna после снижения цены стала самой дешёвой моделью в линейке OpenAI.

Три способа сократить расходы на токены GPT-5.6

Для типовых задач перейти на Terra

Выходные токены Terra стоят $12 за 1 млн — на 60% дешевле, чем $30 за 1 млн у Sol. В Artificial Analysis Coding Agent Index Terra набирает чуть больше баллов, чем Claude Fable 5. После июльского снижения цены на 20% тариф Terra в $2.00/$12.00 стал ниже прежнего тарифа GPT-5.5.

Когда Sol всё ещё оправдан? В многошаговой отладке, планировании архитектуры для крупных кодовых баз и анализе безопасности. Такие задачи выигрывают от длинных цепочек рассуждений. Для обычного программирования, анализа и генерации контента Terra даёт сопоставимый результат при заметно меньшем расходе токенов.

Снизить уровень effort

Параметр reasoning.effort задаёт, сколько токенов reasoning генерирует модель, а описанная ошибка биллинга напрямую масштабируется с числом элементов reasoning (k). На уровне medium Sol выдаёт меньше таких элементов, чем на xhigh, поэтому и завышение счёта пропорционально снижается.

«Я использую Terra Ultra, и расход токенов действительно кажется намного эффективнее, чем у GPT 5.5». — пользователь r/codex

Поведение «печи для токенов» характерно прежде всего для Sol на высоких уровнях effort. Переключение reasoning.effort с xhigh или max на medium либо high — самое эффективное изменение, которое можно внести.

Добиваться максимума попаданий в кэш

В GPT-5.6 появились явные точки разрыва кэша и минимальное время жизни кэша в 30 минут. Чтение из кэша даёт скидку 90%: стоимость входных токенов Sol падает с $5.00 до $0.50 за 1 млн. Но запись в кэш стоит 1,25 от входного тарифа — $6.25 за 1 млн у Sol.

Стройте промпты так, чтобы системное сообщение и статичный контекст находились перед точкой разрыва кэша. Точка окупаемости зависит от конкретной нагрузки: надбавка за запись в кэш составляет 25% от входного тарифа, а экономия на чтении — 90%. Поэтому доля попаданий должна быть такой, чтобы экономия на чтениях превысила надбавку за запись. Если большинство запросов использует общий длинный системный промпт, баланс быстро складывается в вашу пользу.

FAQ

OpenAI признала ошибку биллинга?

Сотрудник OpenAI Mark G. ответил на сообщение на форуме сообщества 12 июля 2026 года и запросил ID запросов и временные метки для расследования. На август 2026 года публичного подтверждения исправления или ретроактивной корректировки счетов нет.

Как проверить, затрагивает ли ошибка мой аккаунт?

Для любого ответа с несколькими элементами reasoning сложите usage.output_tokens_details.reasoning_tokens и токены видимой части ответа. Если usage.output_tokens превышает эту сумму более чем на несколько процентов, на ваш счёт, вероятно, влияет описанное в отчёте на форуме повторное накопительное суммирование. Скачайте CSV с данными об использовании из панели OpenAI и проверьте показатели по моделям.

Стоит ли переходить с Sol на Terra?

Для большинства API-нагрузок Terra обходится дешевле и показывает конкурентные результаты в бенчмарках программирования. Преимущество Sol проявляется на самых трудных задачах: собственные бенчмарки OpenAI показывают, что Sol сильнее Terra прежде всего в многошаговых рассуждениях и исследованиях безопасности, где дополнительное время на размышления даёт наибольшую отдачу.