AIREITER

Precios de la API de Claude Haiku 5.5: el detalle de los 100.000 tokens

Última actualización: 2026-10-07 19:02:43

Claude Haiku 5.5 parece un modelo económico y fácil de presupuestar… hasta que una petición supera los 100.000 tokens de entrada. Por debajo de ese límite, Anthropic cobra $0.10 por cada millón de tokens de entrada y $0.50 por cada millón de tokens de salida; por encima, las tarifas suben a $0.50 y $2.50. Ese salto de cinco veces en la entrada, más que cualquier reclamo de lanzamiento, es la cifra que debe entrar en tu presupuesto de producción.

Precios de la API de Claude Haiku 5.5, de un vistazo

La tarifa de la API directa separa las peticiones según el tamaño del prompt de entrada (USD por millón de tokens). La tabla utiliza los precios de la plataforma de Claude y el anuncio de lanzamiento de Haiku 5.5 de Anthropic; las tarifas de los marketplaces pueden ser diferentes.

El umbral de 100.000 tokens es la decisión clave

El umbral se aplica al prompt de entrada de la petición. No es un recargo general por utilizar un modelo con una ventana de contexto amplia. Una petición con 90.000 tokens de entrada y 2.000 tokens de salida permanece en el tramo inferior; una petición con 120.000 tokens de entrada utiliza las tarifas superiores de entrada y salida indicadas para el tramo de prompts largos.

Para una petición sencilla con 10.000 tokens de entrada y 500 tokens de salida, el cálculo del tramo inferior es:

(10,000 x $0.10 + 500 x $0.50) / 1,000,000 = $0.00035

Con 10.000 peticiones idénticas, el coste asciende a $3.50, sin contar herramientas, plataforma ni reintentos. Para mostrar cómo cambia el tramo con un prompt largo válido, una petición con 120.000 tokens de entrada y 500 tokens de salida cuesta:

(120,000 x $0.50 + 500 x $2.50) / 1,000,000 = $0.06125

Eso equivale a $612.50 por 10.000 peticiones de este tipo. Cuenta toda la entrada que envías a la API, no solo la pregunta visible.

El anuncio oficial de Anthropic en Reddit afirma que las peticiones de hasta 100.000 tokens son aproximadamente un 90% más baratas que con Haiku 4.5, mientras que las que superan los 100.000 tokens son alrededor de un 50% más baratas. Tómalas como afirmaciones relativas del lanzamiento, no como una garantía de que cualquier carga de trabajo vaya a costar esos porcentajes menos: los reintentos, la longitud de la salida, el comportamiento del tokenizador y los fallos de caché también modifican la factura.

La caché y Batch cambian la tarifa efectiva

La caché de prompts resulta especialmente útil cuando una aplicación envía repetidamente las mismas instrucciones o el mismo paquete de conocimiento. En Haiku 5.5, escribir durante cinco minutos en la caché cuesta 1,25 veces la tarifa de entrada estándar, mientras que leer desde la caché cuesta una décima parte del precio de entrada estándar. En el tramo superior se mantienen las mismas proporciones.

OperaciónHasta 100KMás de 100K
Primer millón de tokens escritos en la caché de cinco minutos$0.125$0.625
Cada millón de tokens leídos desde la caché$0.01$0.05
Cada millón de tokens de entrada en Batch$0.05$0.25
Cada millón de tokens de salida en Batch$0.25$1.25

La caché de cinco minutos suele amortizarse después de unas dos lecturas, porque la prima de escritura se recupera rápidamente. Por ejemplo, escribir un prefijo de un millón de tokens cuesta $0.125 y leerlo cuesta $0.01, frente a los $0.20 de dos lecturas sin caché, antes de contar la salida. La caché de una hora cuesta el doble que la tarifa de entrada base, así que necesita más lecturas repetidas para compensar el coste. El resultado exacto depende de que la clave de caché se mantenga sin cambios y de que la petición permanezca en el mismo tramo de precios.

La API de Batch reduce a la mitad las tarifas de entrada y salida para trabajos asíncronos, como enriquecimientos nocturnos, clasificaciones masivas, backfills y ejecuciones de evaluación. No sustituye al chat síncrono: el intercambio es una mayor latencia. Si tu ruta admite ambas opciones, Batch y la caché pueden combinarse; comprueba los campos finales de usage en lugar de asumir que todas las peticiones han utilizado la caché.

La señal operativa que debes registrar es cache_read_input_tokens, un campo documentado en el esquema de uso de la API Messages de Anthropic. Si sigue en cero después de la primera petición, revisa el orden del prompt, las marcas de tiempo, la serialización de herramientas y la ubicación de cache-control. Un modelo más barato con la caché permanentemente fría puede costar más que una ruta correctamente cacheada con una tarifa nominal superior.

Haiku 5.5 frente a los Haiku anteriores y Sonnet

La comparación siguiente utiliza las tarifas directas publicadas antes de Haiku 5.5. Las tarifas de Haiku 4.5 se incluyen como referencia; no significa que todos los proveedores apliquen precios idénticos.

ModeloEntrada / MTokSalida / MTokInterpretación presupuestaria
Claude Haiku 5.5, <=100K$0.10$0.50Trabajo de gran volumen y salidas cortas
Claude Haiku 5.5, >100K$0.50$2.50Prompts largos cuando la calidad justifica el tramo
Claude Haiku 4.5$1.00$5.00Integraciones existentes que necesitan una referencia conocida
Claude Sonnet 5.5$2.00$10.00Tareas de producción más exigentes

Haiku 5.5 es la primera opción lógica para probar en generación de títulos, clasificación, extracción, enrutamiento, resúmenes breves y otras llamadas de alto volumen ejecutadas por workers. Un usuario de Reddit describió el uso típico de Haiku como “tareas de gran volumen y baja complejidad”, por ejemplo crear el título de una conversación o extraer nombres de software de un texto (u/jam_pod_). Encaja mejor ahí que como sustituto automático de un modelo más potente en cada paso de un agente.

No elijas basándote únicamente en el precio por token. Si Haiku necesita un segundo intento en la mitad de tus peticiones mientras Sonnet entrega resultados aceptados a la primera, la diferencia nominal de dos a uno puede desaparecer. Mide la entrada facturada, la salida facturada, los reintentos y los resultados aceptados sobre una muestra representativa antes de dirigir tráfico de producción.

Una regla de costes para producción

Aplica esta secuencia antes de comprometerte con Haiku 5.5:

  1. Pasa el prompt real por la documentación de recuento de tokens de Anthropic, incluidas las herramientas, los documentos recuperados y el historial de la conversación.
  2. Separa el tráfico entre peticiones de entrada <=100K y >100K; no promedies ambos tramos.
  3. Calcula la salida por separado. Una entrada corta con una respuesta generada larga estará dominada por el coste de salida.
  4. Coloca los prefijos estables detrás del control de caché y genera una alerta cuando las lecturas de caché caigan a cero.
  5. Envía mediante Batch API los trabajos que puedan esperar y reserva el enrutamiento síncrono para las peticiones interactivas.
  6. Compara Haiku 5.5 con Sonnet 5.5 según el coste por resultado aceptado, no por millón de tokens.

Esta regla también cubre la principal incertidumbre de los datos del día del lanzamiento: los precios y la disponibilidad oficiales están claros, pero todavía no existen mediciones independientes consolidadas sobre latencia, tasa de fallos y calidad con contextos largos. En el debate de Reddit aparece la misma duda sin resolver, expresada de forma directa: “¿Qué significa «prompts de hasta 100K»?” (u/ShadowBannedAugustus). Para un equipo de producción, esa pregunta debe resolverse con una prueba de facturación, no con una suposición.

Preguntas frecuentes sobre la API de Claude Haiku 5.5

¿Cuál es el ID del modelo de la API de Claude Haiku 5.5?

Utiliza claude-haiku-5-5 como alias actual, tal como aparece en las notas de lanzamiento de Claude Code de Anthropic. Confirma el ID de snapshot en la documentación de modelos de la API cuando necesites un enrutamiento reproducible.

¿Cuánto cuesta una petición de Haiku 5.5 con 100.000 tokens?

Para 100.000 tokens de entrada y ninguna salida, el cargo de entrada del tramo inferior es de $0.01. La salida se factura por separado a $0.50 por millón de tokens en ese mismo tramo; el tramo superior se aplica cuando el prompt supera el límite documentado.

¿Haiku 5.5 está incluido en Claude Pro o Max?

Una suscripción de Claude y el uso de la API de Claude son productos de facturación independientes, como muestra la tarifa de la plataforma de Claude de Anthropic. Utiliza la tabla de precios de la API para el tráfico programático.

¿El precio de Batch se acumula con la caché de prompts?

La documentación de precios de Anthropic presenta Batch como un descuento del 50% sobre los cargos de tokens que cumplen los requisitos, mientras que el cálculo de los tokens almacenados en caché se mantiene separado. Comprueba los campos finales de usage en tu ruta, porque la elegibilidad de la caché y la compatibilidad específica del proveedor pueden variar.

¿Haiku 5.5 es más barato que Haiku 4.5 en todas las peticiones?

Con las tarifas directas publicadas, Haiku 5.5 es más barato en ambos tramos de entrada. El ahorro real puede reducirse por los reintentos, las salidas más largas, los fallos de caché o una carga de trabajo que necesite un modelo más potente para completarse correctamente.