Claude Haiku 5.5 кажется очевидным выбором для недорогих запросов — ровно до момента, когда входной промпт переваливает за 100 000 токенов. Ниже этого порога Anthropic берёт $0.10 за миллион входных токенов и $0.50 за миллион выходных. Выше — уже $0.50 и $2.50 соответственно. Пятикратный рост стоимости входных данных важнее любых рекламных формулировок о запуске модели: именно его нужно закладывать в продакшен-бюджет.
Цены Claude Haiku 5.5 API: главное
В официальной карте тарифов прямого API запросы разделяются по размеру входного промпта, а цены указаны в долларах США за миллион токенов. Таблица ниже составлена по данным тарифов Claude platform и анонса запуска Haiku 5.5; у маркетплейсов ставки могут отличаться.
Порог в 100 тысяч токенов определяет стоимость запроса
Речь идёт именно об объёме входного промпта конкретного запроса. Это не универсальная надбавка за сам факт наличия у модели большого контекстного окна. Запрос на 90 000 входных и 2 000 выходных токенов остаётся в нижнем тарифе. А запрос на 120 000 входных токенов оплачивается по повышенным ставкам для длинных промптов — и для входа, и для выхода.
Для простого запроса с 10 000 входных и 500 выходными токенами расчёт по нижнему тарифу выглядит так:
(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035
При 10 000 одинаковых запросах получится $3.50 — без учёта инструментов, платформенных сборов и повторных попыток. Чтобы увидеть разницу между тарифами на действительно длинном промпте, возьмём запрос со 120 000 входных и 500 выходными токенами:
(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125
Для 10 000 таких запросов это уже $612.50. При расчёте учитывайте весь объём данных, который отправляется в API, а не только видимый пользователю вопрос.
В официальном анонсе Anthropic на Reddit говорится, что запросы объёмом до 100 тысяч токенов примерно на 90% дешевле Haiku 4.5, а запросы свыше 100 тысяч — примерно на 50%. Это относительные заявления на момент запуска, а не гарантия одинаковой экономии для любой нагрузки: на итоговый счёт влияют повторы, длина ответа, особенности токенизации и промахи кэша.
Кэширование и Batch заметно меняют итоговую ставку
Кэширование промптов особенно полезно, если приложение регулярно отправляет одни и те же инструкции или наборы знаний. Запись в пятиминутный кэш для Haiku 5.5 стоит 1,25 стандартной ставки за входные данные, а чтение из кэша — одну десятую от обычной цены входа. Для повышенного тарифа соотношение остаётся тем же.
| Операция | До 100K | Свыше 100K |
|---|---|---|
| Первые 1 млн токенов, записанные в пятиминутный кэш | $0.125 | $0.625 |
| Каждый 1 млн токенов, прочитанных из кэша | $0.01 | $0.05 |
| Каждый 1 млн входных токенов в Batch | $0.05 | $0.25 |
| Каждый 1 млн выходных токенов в Batch | $0.25 | $1.25 |
Пятиминутный кэш обычно окупается примерно после двух чтений: переплата за запись быстро компенсируется. Например, запись префикса объёмом 1 млн токенов стоит $0.125, а чтение — $0.01. Два чтения без кэша обошлись бы в $0.20 — без учёта выходных токенов. Часовой кэш стоит вдвое дороже базовой ставки за вход, поэтому для окупаемости ему требуется больше повторных чтений. Точный результат зависит от того, сохраняется ли ключ кэша без изменений и остаётся ли запрос в том же тарифном диапазоне.
Batch API вдвое снижает цены на вход и выход для асинхронных задач: ночного обогащения данных, массовой классификации, бэкфиллов и оценочных прогонов. Для синхронного чата это не замена — компромиссом становится задержка. Если маршрут поддерживает оба режима, Batch и кэширование можно сочетать. Но итоговые поля usage всё равно нужно проверять, а не считать заранее, что каждый запрос попал в кэш.
Главный операционный показатель, который стоит логировать, — cache_read_input_tokens. Это поле описано в схеме usage для Messages API Anthropic. Если после первого запроса оно продолжает показывать ноль, проверьте порядок частей промпта, временные метки, сериализацию инструментов и расположение cache-control. Модель с более низкой номинальной ценой, но постоянно пустым кэшем, может оказаться дороже правильно настроенного маршрута с более высокой ставкой.
Haiku 5.5 против старых Haiku и Sonnet
В сравнении ниже используются опубликованные прямые тарифы, доступные до выхода Haiku 5.5. Цены Haiku 4.5 приведены как ориентир, а не как утверждение, что у всех провайдеров ставки одинаковые.
| Модель | Вход / MTok | Выход / MTok | Что это значит для бюджета |
|---|---|---|---|
| Claude Haiku 5.5, <=100K | $0.10 | $0.50 | Большие объёмы задач с коротким ответом |
| Claude Haiku 5.5, >100K | $0.50 | $2.50 | Длинные промпты, если качество оправдывает более высокий тариф |
| Claude Haiku 4.5 | $1.00 | $5.00 | Существующие интеграции с предсказуемой базовой ставкой |
| Claude Sonnet 5.5 | $2.00 | $10.00 | Более требовательные продакшен-задачи |
Haiku 5.5 логично первой протестировать для генерации заголовков, классификации, извлечения данных, маршрутизации, коротких саммари и других высоконагруженных фоновых вызовов. Один из пользователей Reddit описал сценарии для Haiku как «high-volume, low-complexity tasks» — например, создание заголовка разговора или извлечение названий программ из текста (u/jam_pod_). Это более реалистичный сценарий, чем считать модель безусловной заменой более сильной модели на каждом шаге агента.
Выбирать модель только по цене токенов не стоит. Если Haiku требует повторной попытки в половине запросов, а Sonnet выдаёт принятый результат с первого раза, номинальная разница в два раза быстро исчезает. Перед переводом трафика в продакшен сравните на репрезентативной выборке оплаченные входные и выходные токены, число повторов и долю принятых результатов.
Практическое правило для продакшена
Перед тем как остановиться на Haiku 5.5, пройдите по этому списку:
- Прогоните реальный промпт через документацию Anthropic по подсчёту токенов, включая инструменты, найденные документы и историю диалога.
- Разделите трафик на запросы с входом
<=100Kи>100K; не усредняйте два тарифа. - Рассчитайте выход отдельно. Короткий входной промпт с длинным ответом может сделать стоимость преимущественно зависимой от выходных токенов.
- Стабильные префиксы отправляйте под управлением кэша и настройте алерт на случай, если чтения из кэша упадут до нуля.
- Задачи, которые могут подождать, отправляйте через Batch API, а для интерактивных запросов оставляйте синхронную маршрутизацию.
- Сравнивайте Haiku 5.5 и Sonnet 5.5 по стоимости принятого результата, а не по цене миллиона токенов.
Это правило учитывает и главный пробел в данных на момент запуска: официальные цены и доступность понятны, но независимых измерений задержки, частоты ошибок и качества работы с длинным контекстом пока недостаточно. В обсуждении на Reddit тот же нерешённый вопрос сформулирован предельно прямо: «Что означает “prompts up to 100k”?» (u/ShadowBannedAugustus). Для продакшен-команды это вопрос для биллингового теста, а не повод строить догадки.
FAQ по Claude Haiku 5.5 API
Какой идентификатор модели Claude Haiku 5.5 API?
Используйте claude-haiku-5-5 как текущий алиас — он указан в примечаниях к выпуску Claude Code Anthropic. Если важна воспроизводимая маршрутизация, уточните ID конкретного снапшота в документации API по моделям.
Сколько стоит запрос Haiku 5.5 на 100 тысяч токенов?
Для 100 000 входных токенов без вывода стоимость входа по нижнему тарифу составляет $0.01. Выход оплачивается отдельно — $0.50 за миллион токенов в том же тарифе. Повышенный тариф применяется, когда объём промпта превышает установленный порог.
Входит ли Haiku 5.5 в Claude Pro или Max?
Подписка Claude и использование Claude API относятся к разным продуктам с отдельным биллингом, что видно из тарифов Claude platform Anthropic. Для программного трафика используйте карту тарифов API.
Суммируется ли цена Batch со скидкой за кэширование промптов?
В документации Anthropic Batch описан как скидка 50% на подходящие для неё начисления за токены, а расчёт токенов из кэша ведётся отдельно. Проверяйте итоговые поля usage для своего маршрута: поддержка и условия кэширования могут различаться у конкретного провайдера.
Дешевле ли Haiku 5.5, чем Haiku 4.5, для любого запроса?
По опубликованным прямым тарифам Haiku 5.5 дешевле в обоих диапазонах входных данных. Но реальная экономия может сократиться из-за повторных попыток, более длинных ответов, промахов кэша или задач, для успешного выполнения которых нужна более сильная модель.