Claude Opus 5 vs GPT-5.6: comparación de Sol, Terra y Luna

Última actualización: 2026-07-25 05:22:42

Si esta semana estás conectando un agente, la elección parece sencilla: claude-opus-5 o gpt-5.6. Pero el segundo no identifica realmente un único modelo: es un alias que apunta a uno de tres SKU, cada uno con su propia tarifa.

La conclusión rápida: por debajo de 272.000 tokens de entrada, los dos buques insignia apenas se separan un 7% en precio; al superar ese umbral, Claude Opus 5 cuesta aproximadamente la mitad que GPT-5.6 Sol. Probamos los cuatro modelos con las mismas cuatro verificaciones el 24 de julio de 2026 y contrastamos cada variable de precio con la documentación de ambos proveedores.

GPT-5.6: una generación con Sol, Terra y Luna

OpenAI lanzó los tres el 9 de julio de 2026. Su referencia de modelos los equipara con los antiguos sufijos de tamaño: Sol corresponde a «the unsuffixed tier of earlier GPT-5 families», Terra al «the mini model tier» y Luna al «the nano model tier». Son tres SKU de una misma generación, no tres generaciones distintas.

La cadena sin sufijo gpt-5.6 funciona como alias. El registro de cambios de OpenAI la dirige a gpt-5.6-sol, de modo que una configuración que invoque gpt-5.6 se factura a la tarifa más alta de la familia.

VarianteID del modeloEquivalencia de gamaEntrada / salida por 1M (≤272K)Calificación de razonamiento
Solgpt-5.6-sol (alias gpt-5.6)sin sufijo$5.00 / $30.00La más alta
Terragpt-5.6-terramini$2.50 / $15.00Más alta
Lunagpt-5.6-lunanano$1.00 / $6.00Alta

Las coincidencias pesan más que las diferencias. Las tres páginas de modelo indican exactamente lo mismo:

  • Ventana de contexto de 1.050.000 tokens y salida máxima de 128.000
  • Corte de conocimiento del 16 de febrero de 2026
  • Entrada de texto e imagen, salida de texto; sin ajuste fino ni snapshots fechados
  • La misma escala de esfuerzo y la misma calificación de velocidad «Fast»

Precio y calificación de razonamiento son las únicas diferencias documentadas. Cada página muestra una etiqueta «Default» dentro de su propia gama, por lo que verla en Terra no convierte a Terra en el modelo predeterminado de toda la familia.

Al otro lado, Anthropic ofrece un solo SKU. Claude Opus 5 llegó el 24 de julio de 2026 como claude-opus-5, un snapshot fijado sin sufijo de fecha, con un precio listado de $5 por entrada y $25 por salida por millón de tokens. Su ventana de 1M es a la vez la predeterminada y la máxima.

Programación: cuatro pruebas mecánicas, cuatro aprobados

Enviamos cuatro tareas con criterios de aprobado verificables por máquina a través de una pasarela compatible con OpenAI. Todos los modelos recibieron exactamente el mismo prompt de usuario:

  • Corrección de bug: arreglar kth_smallest, que modificaba la lista del llamador con un sort() in situ y además tenía un error de índice de una posición
  • JSON estricto: orden fijo de claves, contador y suma de comprobación coherentes entre sí
  • Razonamiento: el mayor total imposible de alcanzar usando solo paquetes de 7 y 12, el número de Frobenius: 7×12−7−12 = 65
  • Refactorización: añadir validación sin modificar la firma

Los cuatro lograron 4/4: sorted() o una copia con el índice pasado a k-1, JSON analizable en el orden de claves exigido, 65 y una refactorización limpia. Es una ejecución por cada pareja modelo-tarea, no un benchmark; a esta escala, la corrección no permitió diferenciarlos.

Las afirmaciones más amplias dependen de cifras comunicadas por los proveedores y no reproducidas de forma independiente. El material de lanzamiento de Anthropic sitúa a Opus 5 a menos de un 0,5% de la puntuación máxima de Fable 5 en CursorBench 3.2, con esfuerzo máximo y por la mitad del coste por tarea; es una cifra relativa obtenida por la propia empresa. La página de lanzamiento de GPT-5.6 de OpenAI devuelve 403 a las consultas automatizadas, así que las puntuaciones de programación de Sol corresponden a quienes las publicaron:

Benchmark de tercerosSolTerraLuna
Vellum, Terminal-Bench 2.188.8%87.4%84.7%
Artificial Analysis, Coding Agent Index80 con Codex7775

Las impresiones prácticas no siguen siempre a los marcadores. Un desarrollador que comparó ambos con esfuerzo High publicó el 24 de julio que «GPT 5.6 Sol High is still better at coding than Claude Opus 5 High».

La guía de migración de Anthropic añade un detalle útil: Opus 5 revisa su propio trabajo. Por eso, los prompts heredados que añaden un paso de verificación ahora pueden llevarlo a verificar en exceso y conviene eliminarlos.

Seguimiento de instrucciones: las diferencias aparecen en el formato

Dos de las comprobaciones eran, en el fondo, pruebas de seguimiento de instrucciones: la tarea de JSON exigía items en orden alfabético ascendente, una suma de comprobación de 14 y ninguna clave extra; la refactorización pedía lanzar ValueError, sin comentarios ni docstrings, una condición que los modelos suelen incumplir al documentar lo que hacen. Los cuatro superaron ambas.

La forma de la salida sí cambió. Sol y Luna encapsularon la respuesta en LaTeX y devolvieron \boxed{65}; Opus 5 y Terra entregaron un número sin adornos. Una expresión regular que extraiga el último entero sobrevive a ambos formatos; un parser que espere solo un numeral o un campo JSON, no. Y esos valores predeterminados son los que heredas al sustituir claude-opus-5 por gpt-5.6 sin tocar nada más.

Eficiencia de tokens: 1.182 de salida frente a 464 de Sol

Dos valores predeterminados de configuración explican de forma plausible la diferencia siguiente, y ninguno tiene que ver con la calidad. Opus 5 llega con thinking activado y esfuerzo high por defecto tanto en la API como en Claude Code, por lo que una llamada simple ya es una petición de razonamiento. GPT-5.6 parte de medium.

Estos son los tokens visibles de finalización acumulados en las cuatro tareas, con el coste calculado a las tarifas oficiales de salida. Una petición por pareja, sin reintentos y con los ajustes predeterminados:

ModeloTokens de salidaTarea de refactorizaciónCoste, solo salida
Claude Opus 51,182600 tok / 8.3s$0.0296
GPT-5.6 Sol464321 tok / 12.0s$0.0139
GPT-5.6 Terra737603 tok / 11.8s$0.0111
GPT-5.6 Luna612380 tok / 8.7s$0.0037

Hay que leer esos costes con dos salvedades. Para el mismo prompt de usuario, la pasarela registró entre 62 y 4.471 tokens de prompt en los modelos GPT, mientras que Claude se mantuvo entre 592 y 640. Las solicitudes, por tanto, no eran idénticas en la transmisión: no hay una cifra significativa para el lado de entrada y la diferencia no puede atribuirse limpiamente a una causa concreta.

La guía de razonamiento de OpenAI tampoco muestra los resúmenes de razonamiento salvo que se activen expresamente, y GPT-5.6 factura esos tokens ocultos como salida. Los tres costes de GPT infravaloran por ello la factura. La corrección es la señal comparable; tokens y latencia solo marcan una dirección.

Gráfico de barras de la latencia total de las cuatro tareas por modelo: Opus 5 24,6 segundos, Opus 4.8 11,8, Sonnet 5 13,7, GPT-5.6 Terra 22,7, Sol 20,3 y Luna 18,4

El gráfico incorpora también Opus 4.8 y Sonnet 5, referencias del lado de Claude obtenidas en la misma ejecución. Opus 5 fue el más lento de los seis: 24,6 s entre las cuatro tareas, frente a 20,3 s de Sol, 22,7 s de Terra y 18,4 s de Luna. Opus 4.8 tiene thinking desactivado por defecto y terminó en 11,8 s, lo que apunta a una diferencia de configuración más que de capacidad.

Artificial Analysis, que evaluó Opus 5 el día de su lanzamiento, describió su ajuste de esfuerzo como un rango de uso de tokens más amplio que el de los modelos de otros laboratorios. Su coste, por tanto, es más ajustable de lo que sugiere la lista de precios.

Precio: el salto de los 272K, en dólares

Una sola frase publicada decide la parte económica de Claude Opus 5 vs GPT-5.6. A tarifa principal, los buques insignia parecen casi idénticos: Opus 5 cuesta $5/$25 por millón de tokens, mientras que Sol cobra $5 por entrada y $30 por salida. Opus 5 es así un 17% más barato en salida e idéntico en entrada. Eso se mantiene hasta 272.000 tokens de entrada, y no más allá.

Las tres páginas de modelo de GPT-5.6 incluyen la misma nota: «Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request.» Afecta a toda la solicitud, no únicamente a los tokens que sobrepasan la línea. Basta superar los 272K por un token para que Sol facture $10/$45 por toda la llamada, mientras que la ventana de 1M de Opus 5 sigue en $5/$25 de principio a fin.

Documentación de precios para desarrolladores de OpenAI con grupos de columnas separados para contexto corto y largo, que lista gpt-5.6-sol a $5.00 de entrada y $30.00 de salida, gpt-5.6-terra a $2.50 y $15.00, y gpt-5.6-luna a $1.00 y $6.00 por millón de tokens

Tomemos una solicitud agéntica con 20.000 tokens de salida y variemos la entrada, usando las tarifas publicadas por OpenAI y las tarifas estándar de Anthropic, ambas consultadas el 25 de julio de 2026:

Tokens de entradaClaude Opus 5GPT-5.6 SolGPT-5.6 Terra
200,000$1.50$1.60$0.80
400,000$2.50$4.90$2.45
900,000$5.00$9.90$4.95

Por debajo del límite, los buques insignia solo se separan un 7%. Por encima, Sol cuesta 1,96 veces Opus 5 con 400K tokens de entrada y 1,98 veces con 900K. Cien solicitudes con el perfil de 400K supondrían, por tanto, $250 frente a $490.

Gráfico de líneas del coste por solicitud con 20.000 tokens de salida a medida que la entrada crece hasta 900K: GPT-5.6 Sol sigue a Claude Opus 5 hasta 272K, luego salta a $3.90 con 300K y asciende a $9.90, mientras Opus 5 sube de forma uniforme hasta $5.00 y GPT-5.6 Terra da el salto en el mismo límite y continúa junto a Opus 5 hasta $4.95

Terra es la variante que merece atención. Por encima de 272K, paga la misma tarifa de entrada de $5 por millón que Opus 5, de modo que toda la diferencia está en la salida: $2,50 por millón. Son cinco centavos en esta solicitud de 20k tokens de salida, tanto con 300K como con 900K, y crece con la salida, no con la entrada. El umbral es un salto discreto de la tarifa, no la pendiente que dibuja un eje espaciado de forma uniforme.

Tarifas Batch, tokenizadores y el canal de compra

Las modalidades con descuento mantienen la proporción en esa solicitud de 400K:

  • Anthropic Batch API: Opus 5 queda en $2.50/$12.50, con un coste de $1.25 para la solicitud
  • OpenAI Batch y Flex: 50% de descuento sobre la tarifa estándar, por lo que la tarifa de contexto largo de Sol pasa a $5/$22.50, o $2.45 para la misma llamada

Las tarifas por token no son directamente comparables entre proveedores. La documentación de precios de Anthropic señala que los modelos Claude desde 4.7, incluido Opus 5, utilizan un tokenizador más reciente que produce aproximadamente un 30% más de tokens para el mismo texto; la proporción varía según el contenido y el idioma. Un documento que contabilice 400.000 tokens en GPT-5.6 se acercaría a 520.000 en Opus 5, elevando la línea de entrada de esa fila de $2.00 a $2.60. Sigue por debajo de los $4.00 de Sol, pero conviene tokenizar los prompts propios antes de decidir.

También importa dónde se compra. AIReiter revende Claude por debajo de la tarifa oficial: Opus 4.8 cuesta $1.56/$7.76 por millón de tokens, alrededor de un 69% menos. Su catálogo llega hasta Fable 5 y Opus 4.8, así que Opus 5 todavía no se puede invocar allí. Dentro de la propia gama de Anthropic, la comparación relevante es Fable 5 a $10/$50 frente a Opus 5 a $5/$25.

Contexto: ambos anuncian 1M, pero solo uno lo cobra a tarifa plana

La ventana de Opus 5 es de 1.000.000 de tokens, y coincide su valor predeterminado con su máximo; no existe una variante de contexto reducido que pueda seleccionarse por error. Las tres variantes de GPT-5.6 ofrecen 1.050.000, una ventana un 5% mayor. La salida máxima es de 128.000 en ambos casos, con una asimetría: en Anthropic Batch API, una cabecera beta output-300k-2026-03-24 eleva el límite de Opus 5 a 300.000.

Sol acepta un prompt de 900K tokens y cobra la tarifa de contexto largo por toda la solicitud, de modo que aproximadamente el 74% de su ventana anunciada queda por encima del tramo barato. La capacidad con contextos largos es otra cuestión: el análisis de Vellum sitúa a Luna en 41,3% en MRCR, frente a 91,5% de Sol y 89,6% de Terra. Es un motivo para mantener la gama nano fuera de trabajos de contexto largo, independientemente de su coste. Anthropic también asigna a Opus 5 un corte de conocimiento de mayo de 2026, mientras las tres páginas de GPT-5.6 indican el 16 de febrero de 2026.

Controles de razonamiento: una escala y dos enfoques

Opus 5 no necesita cabecera beta para ningún nivel de esfuerzo y activa thinking de serie. Desactivarlo tiene un límite claro: thinking: {"type": "disabled"} solo se acepta con esfuerzo high o inferior, y devuelve un 400 con xhigh o max, algo que Anthropic marca como cambio incompatible respecto a modelos anteriores.

ControlClaude Opus 5GPT-5.6
Escala de esfuerzolowmediumhighxhighmaxnonelowmediumhighxhighmax
Esfuerzo predeterminadohigh en API y Claude Codemedium
Segundo controlningunoreasoning.mode: standard (predeterminado) o pro
Razonamiento desactivadono disponible por encima de esfuerzo higheffort: none

Esos dos valores de modo son los únicos que documenta la guía de razonamiento de OpenAI. La API no expone ningún valor ultra, ni explica el mecanismo interno del modo Pro. El registro de cambios del 9 de julio enumera razonamiento persistente, esfuerzo max y modo Pro como incorporaciones de esta familia.

La diferencia práctica es esta: GPT-5.6 puede eliminar por completo el razonamiento en llamadas críticas para la latencia, algo que Opus 5 no permite por encima de high. Opus 5, en cambio, ofrece un rango dinámico mayor dentro del razonamiento. Un desarrollador que seguía ambos acabó usando una sola escala entre proveedores: Luna high, Sol medium y después Opus medium, high y xhigh.

Disponibilidad, límites de tasa y ajuste fino

Opus 5 se puede invocar desde Claude API, Amazon Bedrock como anthropic.claude-opus-5, Google Cloud, Microsoft Foundry, claude.ai, Claude Code y Claude Cowork; además, es el nuevo valor predeterminado en Claude Max. El modo rápido de Anthropic, a $10/$50 y con aproximadamente 2,5 veces más rendimiento, existe solo en Claude API.

Las tres variantes de GPT-5.6 son productos de OpenAI API, y el nivel gratuito de la API no incluye ni Sol ni Terra. Los límites documentados de Sol suben de 500 RPM en Tier 1 a 15.000 en Tier 5; Terra comparte ese máximo. Ninguno de los tres admite ajuste fino ni expone un snapshot fechado, por lo que fijar una versión significa usar el ID simple y aceptar actualizaciones in situ.

Qué modelo usar en cada caso

Primero comprueba el tamaño de entrada: es el único eje con una discontinuidad de precio publicada. Después, la caché, la elegibilidad para batch y el volumen de salida mueven el coste total.

Por debajo de 272K, los buques insignia están lo bastante cerca como para que decidan los desempates. Por encima, la economía a precio de lista favorece a Opus 5 frente a Sol por aproximadamente 2x. Esa ventaja no se extiende a toda la familia: Terra por encima del umbral cuesta $2.45 frente a los $2.50 de Opus 5 para la misma solicitud. El ahorro en contexto largo es, por tanto, una comparación con Sol, no con GPT-5.6 en conjunto.

  • Claude Opus 5: prompts grandes, una tarifa plana en toda una ventana de 1M, conocimiento hasta mayo de 2026 o inferencia que deba ejecutarse en Bedrock, Google Cloud o Foundry.
  • GPT-5.6 Terra: la opción predeterminada para volumen, ya que cuesta menos que Opus 5 en ambos extremos del rango.
  • GPT-5.6 Sol: cuando lo necesario sea el modo pro o el esfuerzo none. Justifica su sobreprecio por los controles, no por una ventaja de corrección que hayamos podido medir.
  • GPT-5.6 Luna: trabajo superficial y de gran volumen, evitando tareas con contextos largos.

La elección entre Claude Opus 5 y GPT-5.6 se reduce a una decisión por tramo de tamaño de entrada, y ambos proveedores publican claramente dónde está ese límite.

Preguntas frecuentes

¿Claude Opus 5 es mejor que GPT-5.6 para programar?

En nuestras cuatro pruebas mecánicas, Opus 5, Sol, Terra y Luna lograron 4/4, de modo que la corrección no los distinguió a esta escala. Los desarrolladores que han probado ambos con esfuerzo High tampoco coinciden. El coste es más concluyente: por encima de 272K tokens de entrada, Opus 5 cuesta aproximadamente la mitad que Sol.

¿Qué diferencia hay entre GPT-5.6 Sol, Terra y Luna?

El precio y una calificación cualitativa de razonamiento. La documentación de OpenAI equipara Sol con la antigua gama sin sufijo, Terra con mini y Luna con nano, a $5/$30, $2.50/$15 y $1/$6 por millón de tokens por debajo de 272K tokens de entrada. Ventana de contexto, salida máxima, corte de conocimiento, modalidades y escala de esfuerzo son idénticos en los tres.

¿Qué IA es mejor, GPT o Claude?

Depende del eje de comparación, y la mayor diferencia publicada está en uno que ninguno de los dos proveedores promociona. benchlm.ai registra una tasa de alucinación AA-Omniscience de 35,9% para Claude Opus 4.8 frente a 88,8% para GPT-5.6 Sol, aunque puntúa a Sol por delante en matemáticas, conocimiento y categorías agénticas. Es la pareja publicada más próxima; ningún agregador incluye aún datos de Opus 5 o Terra. Si las respuestas erróneas cuestan más que las respuestas ausentes, ese orden pesa más que cualquier puntuación de programación.

¿Debería usar GPT-5.6 Terra en lugar de Sol?

Para la mayoría del volumen, sí. Profesionales que enrutan por profundidad en r/codex indican una distribución aproximada de Terra para el 75% del trabajo, Luna para el 15% y Sol para el 10%. Artificial Analysis sostiene que la gama intermedia está dominada, porque algún ajuste de Luna o Sol suele igualarla a igual o menor coste; prueba Terra contra sus dos vecinas antes de dar por hecho que el escalón medio es la opción segura.

¿GPT-5.6 tiene un modo de razonamiento ultra?

La API expone reasoning.mode con dos valores documentados, standard y pro, junto con reasoning.effort desde none hasta max. El modo Pro llegó en el registro de cambios del 9 de julio de 2026. No aparece ningún valor ultra en la guía de razonamiento de OpenAI ni en las páginas de los modelos.

Más lecturas