Desde el 30 de julio de 2026, usar GPT-5.6 Luna cuesta un 80% menos y GPT-5.6 Terra, un 20% menos. Sol conserva su tarifa estándar, y en agentes con varias interacciones la factura por escrituras de caché puede absorber buena parte del ahorro antes de que llegue a tu factura.
Los cambios de precio del 30 de julio de 2026
Las rebajas entraron en vigor el 30 de julio de 2026 y se aplican a los identificadores de modelo ya existentes. OpenAI explicó que reducía ambas tarifas tras mejorar la eficiencia de los sistemas que los sirven. La tarifa estándar de GPT-5.6 Sol no cambió.
| Modelo | ID de modelo | Entrada antes | Entrada ahora | Salida antes | Salida ahora |
|---|---|---|---|---|---|
| GPT-5.6 Luna | gpt-5.6-luna | $1.00 | $0.20 | $6.00 | $1.20 |
| GPT-5.6 Terra | gpt-5.6-terra | $2.50 | $2.00 | $15.00 | $12.00 |
| GPT-5.6 Sol | gpt-5.6-sol | $5.00 | $5.00 | $30.00 | $30.00 |
Precios por 1M de tokens, nivel estándar y contexto corto, según la documentación de precios de la API de OpenAI (verificada el 2026-07-31).
Decir que «la serie GPT-5.6 se ha abaratado» es cierto solo en dos terceras partes. Junto con las rebajas, OpenAI incorporó un modo Fast para Sol: $10.00 de entrada y $60.00 de salida. Cuesta el doble que la modalidad estándar, ofrece hasta 2.5× más rendimiento y no altera el modelo subyacente. La documentación indica que Fast mode es la función antes denominada procesamiento prioritario. Es decir, el nivel insignia estrenó una opción más cara el mismo día que los dos niveles económicos bajaron de precio.
Indica siempre el ID de modelo completo, no solo el nombre de la serie. El catálogo de modelos de OpenAI registra gpt-5.6 como alias de gpt-5.6-sol; si enrutas usando el nombre corto esperando acceder al nivel económico, se te cobrará la tarifa del modelo insignia. Además, algunos revendedores ni siquiera ofrecen ese alias: en el endpoint de AIReiter, gpt-5.6 devuelve Model 'gpt-5.6' not found (prueba realizada el 2026-07-31).
La reacción de los desarrolladores se ha centrado menos en la magnitud de la rebaja que en si será sostenible:
No hay forma de que los modelos 5.6 de OpenAI cuesten realmente tan poco de ejecutar — título de un hilo en r/Anthropic
Luna ya cuesta menos que GPT-5.4 nano: qué nivel elegir
Con $0.20 por entrada y $1.20 por salida, GPT-5.6 Luna cuesta ahora menos por token de salida que gpt-5.4-nano ($0.20 / $1.25) y muchísimo menos que gpt-5.4-mini ($0.75 / $4.50). Si mantenías llamadas a nano o mini únicamente por precio, ese argumento ya no se sostiene.
Para comprobar si el nivel económico responde bien, ejecuté dos tareas en los tres modelos GPT-5.6 mediante el endpoint compatible con OpenAI de AIReiter el 2026-07-31: extracción de tickets de soporte a JSON con un esquema estricto y un problema aritmético de facturación de tokens con una única respuesta correcta ($23.71). Hice dos ejecuciones por caso, con max_tokens: 4000, sin reintentos y evaluación de aprobado o suspenso frente al resultado esperado.
| Tarea | Modelo | Tokens de entrada | Tokens de salida | Latencia (ejecución 1 / ejecución 2) | Correcto |
|---|---|---|---|---|---|
| Ticket → JSON | Luna | 135 | 77–78 | 4.0s / 3.5s | Sí |
| Terra | 135 | 46 | 2.1s / 2.1s | Sí | |
| Sol | 135 | 46 | 2.3s / 2.2s | Sí | |
| Aritmética de facturación | Luna | 119 | 111–122 | 3.1s / 4.3s | Sí |
| Terra | 119 | 87–89 | 3.8s / 2.8s | Sí | |
| Sol | 4,488 | 84–87 | 3.5s / 3.2s | Sí |
Hay dos resultados especialmente relevantes.
Luna fue el más lento de los tres en extracción, no el más rápido: 3.5–4.0s frente a los 2.1s de Terra. Que sea el nivel barato no implica que también sea el de menor latencia.
Sol registró 4,488 tokens de entrada para un prompt que Terra y Luna contabilizaron como 119; 3,840 de ellos estaban marcados como cached_tokens. El comportamiento se repitió exactamente en ambas ejecuciones. Con un prompt trivial ("Reply with only the word OK."), los tres modelos registraron los mismos 24 tokens, por lo que la inflación parece vinculada al prompt y no al modelo. Puedo ver el recuento de tokens, pero no su causa. Conviene tratarlo como un comportamiento de facturación medido en un endpoint, no como una propiedad documentada del modelo.
Aplicando las tarifas estándar oficiales, la misma respuesta correcta costó:
Por 1,000 ejecuciones: Luna $0.16, Terra $1.29 y Sol $7.73. Sol cobró aproximadamente 6× más que Terra y 47× más que Luna por devolver el mismo número de tres cifras.
La muestra es pequeña —dos ejecuciones de dos tareas sencillas—, no es un benchmark y no mide la calidad de razonamiento. Sí respalda una regla práctica: empieza por Luna y escala solo cuando tus propios datos de tráfico muestren fallos. En estas pruebas, pagar Sol cuando Terra ya acertaba no aportó nada. El reparto completo por carga de trabajo aparece en la tabla final.
Por qué una rebaja del 80% puede no reducir tu factura un 80%
La tarifa anunciada se aplica a los tokens de entrada nuevos y a los de salida. Pero el tráfico de agentes con varios turnos está condicionado por una tercera cifra: las escrituras de caché. En los tres niveles de GPT-5.6, una escritura de caché cuesta 12.5× más que una lectura de caché.
| Modelo | Entrada en caché (lectura) | Escritura de caché | Relación |
|---|---|---|---|
| GPT-5.6 Luna | $0.02 | $0.25 | 12.5× |
| GPT-5.6 Terra | $0.20 | $2.50 | 12.5× |
| GPT-5.6 Sol | $0.50 | $6.25 | 12.5× |
Una prueba controlada publicada en la comunidad de desarrolladores de OpenAI el 2026-07-11 ilustra hasta qué punto importa. En seis turnos consecutivos de la Responses API encadenados con previous_response_id, Luna consumió un 3% menos de tokens de entrada y un 29% menos de salida que gpt-5.4-mini, pero costó un 96% más ($0.0651 frente a $0.0332 por conversación). Cerca del 70% de la entrada de Luna se facturó como escrituras de caché. Las cifras son anteriores a la rebaja, pero el mecanismo no ha cambiado.
La parte útil es que, en esa implementación, la causa tenía solución. La caché de GPT-5.6 no puntúa coincidencias parciales: cualquier cambio en el prefijo almacenado obliga a reescribirlo por completo. El autor reconstruía una instantánea creciente de la conversación dentro de instructions, invalidando el prefijo en cada turno.
La diferencia en el diagnóstico fue clara: las instrucciones estables lograron caché en 15 de 15 turnos posteriores del usuario; las instrucciones mutables, en 0 de 15. Al mover ese contexto a un elemento de entrada de desarrollador, el sobrecoste de Luna cayó del 96% al 16.7%; además, Luna fue más rápido y obtuvo mejor puntuación que mini en la revisión ciega del autor. Ni prompt_cache_key ni los puntos de corte explícitos de caché ayudaron.
Antes de asumir que el descuento se ha reflejado en tu coste, haz estas dos cosas:
- No metas contenido variable en el prefijo cacheado. El texto de sistema, las definiciones de herramientas y la personalidad deben ir primero y permanecer idénticos byte a byte; el estado de la conversación debe ir en elementos de entrada.
- Consulta el desglose que devuelve la API. Comparar
usage.prompt_tokens_details.cached_tokensconusage.prompt_tokensrevela en cada llamada qué parte se leyó de caché. En un agente de larga duración, una proporción baja es el error de costes con mayor impacto de esta serie.
Hay tres precios distintos de GPT-5.6: cuál se aplica en tu caso
Al buscar el precio de GPT-5.6 Luna aparecen al menos tres cifras diferentes, y todas son o fueron correctas para algún nivel. Comprobar a qué nivel corresponde cada precio resuelve la mayor parte de la aparente contradicción.
| Dónde lo viste | Entrada / salida de Luna | Qué representa |
|---|---|---|
| $0.20 / $1.20 | Nivel estándar, contexto corto | La opción predeterminada en una llamada normal a la API |
| $0.10 / $0.60 | Niveles Batch y Flex | Exactamente la mitad de la tarifa estándar, para trabajo asíncrono y de menor prioridad |
| $0.40 / $2.40 | Modo Fast | El doble de la tarifa estándar |
| $1.00 / $6.00 | Tarifa estándar anterior al 30 de julio | Correcta hasta la rebaja |
Hay otros dos modificadores en la misma documentación de precios: el contexto largo se factura a 2× la tarifa de entrada de contexto corto y a 1.5× la de salida —la fila de contexto largo de Luna es $0.40 / $1.80, no $0.40 / $2.40—, y la documentación indica un incremento del 10% en endpoints aptos para residencia de datos para modelos lanzados a partir del 2026-03-05, lo que incluye toda la familia GPT-5.6.
Cuando una página de precios no coincide con tu factura, hay dos comprobaciones que suelen resolverlo: localiza la fecha de verificación de la página y contrástala con la documentación oficial de precios del nivel concreto que utilizas. Los agregadores y revendedores también publican sus propias tarifas: constituyen una tercera categoría, no necesariamente precios desactualizados, sino precios distintos.
En AIReiter, los tres niveles de GPT-5.6 cuestan el 50% de la tarifa de lista de OpenAI, y eso acompañó la rebaja del 30 de julio: GPT-5.6 Luna cuesta $0.10 / $0.60, Terra $1.00 / $6.00 y Sol $2.50 / $15.00. La misma reducción a la mitad se aplica a la entrada cacheada y a las escrituras de caché.
Para un agente Terra que procesa 1M de tokens de entrada y 200K de salida al día, esto supone $4.40 diarios a tarifa de lista frente a $2.20: misma llamada, mismo ID de modelo.
La posición de Luna en el mercado más amplio es otra cuestión. En la comparativa de VentureBeat del 30 de julio con 30 modelos, la tarifa combinada de Luna de $1.40 queda por debajo de Gemini 3.5 Flash-Lite ($2.80) y Gemini 3.1 Flash-Lite ($1.75), pero por encima de DeepSeek v4-flash ($0.42). Si tu único criterio es el coste, las API de LLM más baratas no son las de OpenAI.
Preguntas frecuentes
¿GPT-5.6 Sol también ha bajado de precio?
No. La tarifa estándar de Sol sigue en $5.00 de entrada y $30.00 de salida por 1M de tokens. Sí ha incorporado un modo Fast por el doble de precio, con hasta 2.5× más rendimiento.
¿GPT-5.6 Luna es ahora el modelo de API más barato?
No. Con $1.40 combinados por 1M de tokens está entre los modelos económicos de series frontier, pero la tabla de VentureBeat del 30 de julio sitúa por debajo a DeepSeek v4-flash ($0.42), MiMo-V2.5 Flash de Xiaomi ($0.40) y DeepSeek v4-pro ($1.305).
¿Por qué algunas páginas muestran $1 / $6 para GPT-5.6 Luna?
Era la tarifa estándar anterior al 30 de julio de 2026. Revisa la fecha de verificación indicada en la página y confírmala después en la documentación oficial de precios del nivel que utilizas.
¿La rebaja también se aplica a Batch y Flex?
Sí. Batch y Flex cuestan la mitad de la tarifa estándar, de modo que Luna sale a $0.10 / $0.60 y Terra a $1.00 / $6.00 en esos niveles, incluida la entrada cacheada y las escrituras de caché.
¿Tengo que cambiar mi código para obtener el nuevo precio?
No. La rebaja se aplica a los IDs de modelo existentes gpt-5.6-luna y gpt-5.6-terra, sin migración. El único cambio que merece la pena hacer es auditar tu proporción de lecturas de caché, que es donde más a menudo se pierde el descuento.
Qué nivel usar según la carga de trabajo
| Carga de trabajo | Nivel | Motivo |
|---|---|---|
| Extracción, etiquetado y resumen a gran volumen | Luna | Superó las dos tareas de prueba; $1.40 combinados por 1M, ahora por debajo de gpt-5.4-nano |
| Llamadas de cara al usuario sensibles a la latencia | Terra | En extracción fue más rápido que Luna (2.1s frente a 3.5–4.0s) |
| Primera escalada cuando Luna no alcanza el nivel de calidad | Terra | $14 combinados frente a los $35 de Sol |
| Tareas en las que Terra rinde de forma medible peor con tu tráfico | Sol | La única justificación para pagar 6× el coste medido por tarea de Terra |
| Agentes de varios turnos en cualquier nivel | Arregla primero la caché | Las escrituras de caché cuestan 12.5× más que las lecturas; un mal prefijo pesa más que la elección de nivel |