AIREITER

Precios de la API de Claude 2026: cada modelo y cómo pagar menos

Última actualización: 2026-06-30 08:51:39

El precio de la API de Claude va desde $1 por millón de tokens (entrada de Haiku 4.5) hasta $50 por millón (salida de Fable 5) a julio de 2026, y en todos los modelos actuales se cumple la regla: los tokens de salida cuestan 5× los tokens de entrada. Pero el precio de etiqueta es la parte fácil. Un nuevo tokenizer, el enrutamiento solo para EE. UU., el modo rápido y una trampa de facturación que la mayoría nunca nota se interponen entre la tarifa publicada y tu factura real — y hay una forma de comprar los mismos modelos por una fracción del precio de lista.

Cada número a continuación está en la página oficial de precios de Anthropic; revísala antes de finalizar un presupuesto, ya que las tarifas del modelo cambian.

Precios de la API de Claude en 2026: todos los modelos

Estas son las tarifas actuales por millón de tokens, verificadas con la fijación de precios de Anthropic para julio de 2026 (fuente oficial). Opus 4.8 se lanzó el 28 de mayo de 2026 con la misma tarifa que 4.7.

Modelo

Entrada / 1M

Salida / 1M

Contexto

Claude Fable 5

$10.00

$50.00

1M

Claude Opus 4.8

$5.00

$25.00

1M

Claude Opus 4.7

$5.00

$25.00

1M

Claude Opus 4.6

$5.00

$25.00

1M

Claude Sonnet 4.6

$3.00

$15.00

1M

Claude Haiku 4.5

$1.00

$5.00

200K

Dos cosas que muchos de los guías antiguos se equivocan. Fable 5 — el modelo más capaz de Anthropic — se sitúa por encima del nivel Opus a $10/$50, y toda la línea Opus 4.x (4.6, 4.7, 4.8) se mantiene en $5/$25. Ese $5 en sí es toda una historia: Opus 4.1 costaba $15/$75, y la bajada a $5/$25 en el lanzamiento de 4.6 fue un recorte del 67% en el modelo insignia, que se ha mantenido durante tres lanzamientos desde entonces.

Opciones heredadas y económicas

Si no necesitas los modelos más nuevos, los anteriores siguen activos: Sonnet 4.5 ($3/$15), Opus 4.5 ($5/$25, contexto de 200K), Haiku 3.5 ($0.80/$4) y Haiku 3 ($0.25/$1.25) para el trabajo de alto volumen más sensible al costo.

Un detalle infravalorado: Opus 4.6/4.7/4.8, Sonnet 4.6 y Fable 5 incluyen todos la ventana de contexto completa de 1M tokens al precio estándar — sin recargo por contexto largo. Una solicitud de 900K tokens cuesta la misma tarifa por token que una de 9K, mientras que varios competidores cobran un extra a partir de un umbral de longitud.

Los costos que no figuran en la tarjeta de precios

La tabla de tarifas es donde la mayoría de los artículos sobre precios se detienen, y donde empiezan las sorpresas, porque varias cosas modifican tu factura real sin cambiar el precio por token.

El tokenizador que añade tokens silenciosamente

Opus 4.7 (y Opus 4.8, que comparte su tokenizador) cambió la forma en que el texto se divide en tokens. La misma entrada puede producir hasta ~35% más tokens que en Opus 4.6 — a la misma tasa por token. El código, los datos estructurados (JSON/XML) y el texto en otros idiomas son los más afectados, porque la tasa no cambió pero el número de tokens sí. No tomes el 35% como garantía: antes de confiar en un presupuesto antiguo, vuelve a ejecutar tus prompts reales a través del endpoint de conteo de tokens en el nuevo modelo y compáralo.

Pensando, modo rápido y enrutamiento solo para EE. UU.

Según la documentación de precios de Anthropic:

  • Los tokens de pensamiento extendido se facturan como salida, incluso cuando nunca se muestran. Una solicitud que requiere mucho razonamiento acumula discretamente el lado de salida de la factura.

  • El modo rápido (solo Opus 4.8/4.7) ejecuta el mismo modelo hasta 2,5× más rápido a un precio estándar de 2×.

  • La inferencia solo en EE. UU. (residencia de datos) añade un multiplicador de 1,1× en la entrada y la salida; AWS Bedrock o los endpoints regionales de Vertex añaden aproximadamente otro 10% encima.

Herramientas del lado del servidor

Las herramientas que se ejecutan del lado de Anthropic se facturan por separado, según la misma documentación de precios: la búsqueda web cuesta $10 por cada 1.000 búsquedas más los tokens para procesar los resultados, y la ejecución de código es gratuita hasta un límite mensual, luego alrededor de $0.05/hora por contenedor. (Confirma las cifras actuales en la página de precios: las tarifas de las herramientas del servidor cambian.)

La trampa de facturación que atrapa a los usuarios de Claude Code

Este no aparece en ninguna tarjeta de precios. Si tienes ANTHROPIC_API_KEY configurada en tu shell, Claude Code factura a través de la API de pago por token en lugar de tu suscripción. Las personas que esperaban un precio fijo de $20–$200/mes se han visto sorprendidas por cargos medidos precisamente por esta razón. Revisa tu entorno antes de una sesión larga.

¿Cuánto te costará realmente Claude?

Las tarifas significan poco hasta que las vinculas a una carga de trabajo. Tres ejemplos con los precios actuales, todos con 10,000 solicitudes/día (2,000 tokens de entrada + 500 tokens de salida cada una — 20M tokens de entrada + 5M tokens de salida/día):

  • Un chatbot de soporte en Haiku 4.5 ($1/$5): 20M × $1 + 5M × $5 = $45/día, unos $1,350/mes.

  • Un agente de programación en Sonnet 4.6 ($3/$15): $60 + $75 = $135/día, unos $4,050/mes antes de la optimización.

  • Una app RAG de alto contexto en Opus 4.8 ($5/$25), donde los documentos recuperados elevan mucho más la entrada, sube a la franja alta de cuatro o cinco cifras al mes porque el volumen de entrada domina.

El mismo volumen, tres modelos — solo la elección del modelo hace variar la factura ~3× entre Haiku y Sonnet.

Estos no son techos hipotéticos. Un hilo de r/ClaudeAI siguió a 31 usuarios de Claude Code cuyo uso habría costado aproximadamente $80,000/mes a tarifas de API, con el usuario principal cerca de $18,000 — una estimación de lo que su uso por suscripción costaría en la API medida, no una factura literal. Las cargas de trabajo autónomas intensivas es donde la factura se vuelve real, y precisamente ahí es donde las optimizaciones siguientes dan resultados.

Límites de tasa y niveles de uso

El precio no es la única limitación — la velocidad a la que puedes gastarlo está escalonada. Las nuevas cuentas de API comienzan con límites conservadores de solicitudes por minuto (RPM) y tokens por minuto (TPM) que aumentan automáticamente a medida que la cuenta envejece y crece el gasto acumulado (Tier 1 → 4). Las nuevas cuentas también reciben $5 en créditos gratuitos para probar, sin necesidad de tarjeta. Más allá del rendimiento, Anthropic ofrece niveles de servicio que equilibran disponibilidad y precio: un nivel estándar (el predeterminado), un nivel prioritario para disponibilidad garantizada y un nivel por lotes para el descuento asíncrono del 50% que se indica a continuación. Consulta la documentación de límites de velocidad para conocer los números exactos de tu nivel antes de diseñar para escalar — una cuota que sirvió para tráfico piloto puede necesitar un aumento de nivel para producción.

Suscripción de Claude vs API: ¿cuál es más barata?

La pregunta del mundo real más común, y la respuesta es un umbral, no un veredicto.

  • Claude Pro cuesta $20/mes; Max cuesta $100 o $200/mes. Estos cubren las aplicaciones de Claude y Claude Code dentro de un límite de uso — sin facturación por token.

  • La API es de pago por uso puro, sin mínimo mensual ni límite de uso.

El punto de cruce se sitúa en los millones bajos de tokens por mes — aproximadamente 3–4M en un modelo de gama media (Sonnet), suponiendo una mezcla equilibrada de entrada/salida y que, de otro modo, te mantendrías dentro de la cuota de uso de Pro. Sube con Haiku y baja con Opus, así que tómalo como un rango, no como una línea fija. Por debajo de ese volumen, una suscripción suele ser más barata y sencilla. Por encima —especialmente tráfico de producción o programación agentic intensiva— la tarifa por token de la API gana, y obtienes control (límites de tasa, monitorización, facturación con varias claves) que un plan no ofrece. Para programación durante todo el día, específicamente, los desarrolladores estiman que un plan Max puede ser drásticamente más barato que el mismo trabajo facturado token por token en Opus.

La regla práctica: prototipos y uso individual → suscripción; tráfico de producto a escala → API. Y ten en cuenta la trampa de ANTHROPIC_API_KEY de arriba, o pagarás por ambos lados.

Cómo pagar menos por la API de Claude

Tres palancas reducen la factura estándar sin cambiar los modelos.

1. Almacenamiento en caché de prompts (hasta 90% de descuento en contexto repetido)

Almacena en caché un prefijo estable — un prompt de sistema largo, documentos recuperados, ejemplos few-shot — y las lecturas de caché cuestan 0.1× la tarifa de entrada, un descuento del 90%. El detalle está en la escritura: una escritura de caché de 5 minutos cuesta 1.25× y se amortiza después de una lectura; una escritura de 1 hora cuesta 2× y se amortiza después de dos. Para cualquier cosa con un gran preámbulo fijo que se consulta repetidamente, esta es la palanca individual más importante. (Documentación de almacenamiento en caché.)

2. API por lotes (50% de descuento, en ambas direcciones)

Para cualquier cosa que no necesite una respuesta en tiempo real, la Batch API descuenta la entrada y la salida en un 50% y devuelve el resultado en 24 horas. Sonnet 4.6 baja a $1.50/$7.50; Haiku 4.5 a $0.50/$2.50. El almacenamiento en caché y el procesamiento por lotes se combinan, reduciendo el costo efectivo muy por debajo de la mitad de la tarifa nominal.

3. Enrutamiento de modelos y límites de salida

No ejecute cada solicitud en Opus. Dirija la clasificación, el resumen y la lógica de enrutamiento a Haiku, reserve Sonnet para el término medio y llame a Opus solo cuando la tarea lo necesite — comúnmente un recorte del 40–60% por sí solo. Y dado que la salida cuesta 5× el precio de la entrada, limitar max_tokens es una de las palancas de mayor impacto: reducir la salida promedio de 800 a 500 tokens en un millón de llamadas ahorra dinero real cada mes.

API oficial vs plataformas de relé: ¿puedes pagar menos?

Hay una cuarta vía que la documentación oficial no mencionará: comprar los mismos modelos de Claude a través de un relay. Un API relay (o agregador) se sitúa entre usted y Anthropic, expone un endpoint compatible con Anthropic y cobra su propia tarifa.

¿Por qué puede ser más barato un relay? Principalmente, por tres mecanismos: los relays compran con volumen de uso comprometido que obtiene descuentos que una cuenta individual no puede alcanzar; enrutan de manera eficiente entre regiones y proveedores; y muchos operan con márgenes muy ajustados (o como producto gancho) para atraer desarrolladores. Pero un descuento tan profundo tiene que venir de algún lado: entiende el modelo de una plataforma antes de depender de ella.

Los descuentos varían mucho. Así es como se comparan tres opciones para los mismos modelos de Claude:

Plataforma

Descuento vs lista de Anthropic

Cobertura de modelos

Notas

API oficial de Anthropic

— (base)

Todos, incl. Fable 5 / Opus 4.8

Cache, batch, todas las funciones

OpenRouter

≈ lista (traslada el precio del proveedor)

Muchos modelos, multi-proveedor

Agregador; comodidad por encima del ahorro

EvoLink

~10% de descuento

Hasta Opus 4.7

Endpoint compatible con OpenAI

AIReiter

~80% de descuento

Hasta Opus 4.6

Compatible con Anthropic; el cache se transfiere

AIReiter se sitúa en el extremo agresivo. Esto es a lo que equivale el titular de ~80% por modelo:

Modelo

Oficial (entrada / salida)

AIReiter (entrada / salida)

Ahorras

Claude Haiku 4.5

$1 / $5

$0.20 / $1.00

80%

Claude Sonnet 4.6

$3 / $15

$0.60 / $3.00

80%

Claude Opus 4.6

$5 / $25

$1.00 / $5.00

80%

La integración es inmediata: el endpoint de AIReiter es compatible con la Anthropic Messages API, así que el SDK oficial anthropic funciona cambiando dos líneas — apunta base_url a https://aireiter.com/api y sustituye la clave:

client = anthropic.Anthropic(
    api_key="YOUR_AIREITER_KEY",
    base_url="https://aireiter.com/api",
)

Streaming, multi-turn, visión y cache_control pasan sin cambios, por lo que el descuento de almacenamiento en caché del 90% mencionado arriba se suma a la tarifa base más baja.

Preguntas frecuentes

¿Por qué es tan caro Claude API?

Muchas veces no es la tarifa por token: es el diseño del flujo de trabajo. Los mayores factores de coste son ejecutar todo en Opus cuando Haiku o Sonnet bastarían, el contexto repetido sin caché, la salida sin límite y los tokens de razonamiento que te cobran pero nunca ves. Corregir eso suele importar más que el precio destacado.

¿Existe un nivel gratuito de la API de Claude?

No hay un nivel de producción gratuito permanente, pero las cuentas nuevas obtienen $5 en créditos gratis (no se requiere tarjeta) para probar. Después de eso, se paga según el uso.

Claude API frente a ChatGPT: precios — ¿cuál es más barato?

Depende del nivel que compares. Aproximadamente, por millón de tokens (entrada / salida):

Claude

OpenAI comparable

Haiku 4.5 — $1 / $5

Nivel mini de GPT — dígitos bajos de un solo dígito

Sonnet 4.6 — $3 / $15

nivel medio — comparable

Opus 4.8 — $5 / $25

GPT-5.5 — ~$5 / $30

¿Cómo calculo mi factura mensual de la API de Claude?

Estímelo como: (requests × avg input tokens ÷ 1,000,000 × input rate) + (requests × avg output tokens ÷ 1,000,000 × output rate). Use el endpoint de conteo de tokens para obtener recuentos precisos en sus prompts reales — un tokenizador genérico puede desviarse entre un 15–35% en Claude.

La conclusión

Para la mayoría de los equipos, es una división en tres partes: prototipado o uso individual → una suscripción Pro o Max (más simple, más barata por debajo de ~3–4M tokens/mes); producción en el último buque insignia (Opus 4.8, Fable 5) → la API oficial con caching, batching y routing activados; producción donde Sonnet 4.6 u Opus 4.6 son suficientes → un relay de confianza como AIReiter puede reducir la misma factura hasta en un 80% con un cambio de SDK drop-in.

Elijas lo que elijas, la mayoría de los equipos paga de más por omitir las optimizaciones, no por elegir el nivel equivocado; así que activa las opciones antes de preocuparte por la tarifa.