AIREITER
openaiText Chat

GPT-6 Luna

Ejecuta GPT-6 Luna online y mediante API para resúmenes, extracción y clasificación al 30% de las tarifas oficiales por token de OpenAI. Contexto de 1M de tokens.

Token de entradaEntradaSalidaLectura de cachéCreación de caché
≤ 271,999$0.03 por 1 M de tokens$0.15 por 1 M de tokens$0.003 por 1 M de tokens$0.0375 por 1 M de tokens
> 271,999$0.06 por 1 M de tokens$0.225 por 1 M de tokens$0.006 por 1 M de tokens$0.075 por 1 M de tokens

Precios por millón de tokens. El nivel se aplica a toda la solicitud según los tokens de entrada totales, incluidos los de lectura y escritura en caché.

Ejecutar con API

ENTRADA

SALIDA

Example
Generated in
10.6 seconds
Token de entrada
494
Token de salida
204
Tokens per second
19.25 tokens / second
Time to first token
-

Detalles del modelo

Usa la misma clave de modelo en Playground, solicitudes API y flujos de trabajo internos.

ID del modelo
gpt-6-luna
Proveedor
openai
Protocolo
OpenAI Chat Completions
Ventana de contexto
1,050,000 tokens
Salida máxima
128,000 tokens

Qué puedes hacer con GPT-6 Luna

GPT-6 Luna es el nivel rápido y de bajo costo de la familia GPT-6. Hay cuatro aspectos clave que cambian la forma de diseñar en torno a él, y ninguno de ellos aparece en los textos publicitarios.

El output cuesta 5 veces más que el input

$0.03 por 1M de input frente a $0.15 por 1M de output. Los prompts largos son casi gratuitos; las respuestas largas no. Limitar el máximo de completion tokens reduce tu factura mucho más que recortar el prompt.

Una ventana de 1M con un salto brusco en 272K

La ventana de contexto es de 1.050.000 tokens, pero superar los 272K tokens de input recalcula el precio de toda la solicitud a 2x en input y 1.5x en output, no solo el exceso. Un prompt de 280K tokens cuesta más que dos de 140K.

Razona antes de responder

En nuestras pruebas, el primer token transmitido por streaming tardó entre 5,0 y 5,6 segundos de una respuesta total de 7,2 a 7,4 segundos. El streaming no oculta esa brecha. Si necesitas que el texto aparezca antes en pantalla, reduce el esfuerzo de razonamiento en lugar del límite de output.

El output estructurado se mantiene sin un schema

Al solicitarle en prosa simple cuatro campos específicos en JSON, devolvió exactamente esas cuatro claves en un bloque delimitado, sin schema, sin definición de funciones y sin reintentos. La muestra anterior es esa respuesta sin editar.

Precios de GPT-6 Luna

AIReiter ofrece GPT-6 Luna al 30% de las tarifas oficiales de la API de OpenAI. Las tarifas a continuación fueron verificadas con la lista de precios de OpenAI el 23 de septiembre de 2026; las tarifas en tiempo real por token se muestran arriba del playground.
01

Tokens de input

$0.03 por 1M de tokens, frente a los $0.10 oficiales de OpenAI.

02

Tokens de output

$0.15 por 1M de tokens, frente a los $0.50 oficiales de OpenAI.

03

Lecturas de input en caché

$0.003 por 1M de tokens, frente a los $0.01 oficiales de OpenAI.

04

Nivel de contexto largo

Las solicitudes que superan los 272K tokens de input aplican el recargo de la propia OpenAI: 2x en input y 1.5x en output.

Casos de uso de GPT-6 Luna

Luna se gana su lugar dondequiera que el coste por registro sea la limitación. Las cifras siguientes proceden de la ejecución medida que se muestra en el playground: 494 tokens de entrada y 204 de salida por ticket.
01

Triaje de soporte a $0.05 por cada 1.000 tickets

Resumen más severidad, área de producto, versión afectada y etiqueta de prioridad, en una sola llamada por ticket. Un backlog de 50.000 tickets se reprocesa por alrededor de $2.30.

02

Enriquecimiento por lotes con un prefijo en caché

Los trabajos por lotes repiten las mismas instrucciones en cada fila. Mantén ese prefijo idéntico a nivel de bytes y la parte repetida se leerá a $0.003 por 1M en lugar de $0.03: una décima parte del costo de input en toda la ejecución.

03

Nivel predeterminado detrás de un router

Envía todo a Luna y escala únicamente lo que no supere una validación. Como Sol cuesta aproximadamente 20 veces más, un router que mantenga el 95% del tráfico en Luna paga cerca de una décima parte de lo que costaría un flujo exclusivo en Sol; el 5% que se escala representa la mitad de la factura restante.

04

Documentos completos por debajo de la línea de los 272K

Los informes, transcripciones y contratos caben en la ventana de 1M, pero mantente por debajo de los 272K tokens de input por solicitud para evitar la tarifa 2x. Dividir en fragmentos por debajo de ese límite suele ser más económico que realizar una sola llamada grande.

Cómo utilizar GPT-6 Luna

Luna es un modelo para grandes volúmenes, así que pruébalo tal como lo vas a ejecutar: en un registro real y con la configuración que te puedas permitir a escala.

01

Pega un registro real

Utiliza un ticket, una transcripción o un documento real en lugar de un prompt de prueba. El modo de fallo de Luna se debe a entradas desordenadas, no al razonamiento complejo.

02

Ajusta a la baja, no al alza

Empieza con un esfuerzo de razonamiento bajo y un límite ajustado de max completion tokens. La salida cuesta 5 veces más que la entrada, por lo que el límite de salida es la palanca que determina tu factura.

03

Multiplica el recuento de tokens

Toma el uso reportado debajo de la respuesta, multiplícalo por tu volumen diario y obtendrás el coste mensual antes de escribir una sola línea de código de integración.

Desarrolla con la API de GPT-6 Luna

Lo que importa en una integración por lotes no es la primera llamada, sino la diezmilésima: el coste por registro, el comportamiento de la caché y qué ocurre cuando falla una fila.

ID de modelo de sustitución directa

Apunta un cliente compatible con OpenAI existente a gpt-6-luna y no cambies nada más. El streaming, los system prompts y la salida en formato JSON se comportan igual que en el proveedor original.

Los prefijos en caché valen la pena aquí

Los trabajos por lotes repiten las mismas instrucciones en cada fila. Las lecturas en caché cuestan $0.003 por 1M frente a $0.03 para entradas nuevas, por lo que vale la pena estructurar un prefijo de prompt estable.

Contabilidad de costes por respuesta

Cada respuesta informa de la entrada, la salida, las lecturas en caché y los créditos consumidos, de modo que una canalización puede registrar la economía unitaria por registro en lugar de descubrirla en la factura.

Escala a GPT-6 Sol sin reestructurar la integración

Sol y Luna comparten un único endpoint, una sola clave y un único saldo, por lo que desviar una fila difícil al nivel superior es simplemente cambiar el model-ID, no hacer una segunda integración.

GPT-6 Luna vs. GPT-6 Sol vs. GPT-5.6 Luna

La misma tarea de ticket de soporte —resumir más extraer cuatro campos— medida en AIReiter el 23 de septiembre de 2026 con 494 tokens de entrada y 204 de salida, completada en 10.6 segundos en Luna. Los niveles se diferencian aproximadamente por un factor de veinte en el precio, no por su capacidad para realizar este trabajo.
01

GPT-6 Luna: alrededor de $0.05 por cada 1000 tickets

$0.03 de entrada y $0.15 de salida por 1M de tokens en AIReiter, frente a los $0.10 y $0.50 oficiales de OpenAI. El nivel de GPT-6 más económico y el que hace viable la ecuación de la automatización por registro.

02

GPT-6 Sol: alrededor de $0.91 por cada 1000 tickets

$0.60 de entrada y $3.00 de salida por 1M de tokens, aproximadamente 20 veces más que Luna. Vale la pena cuando una tarea requiere un razonamiento de primer nivel; un desperdicio cuando la tarea es una extracción que Luna ya resuelve bien.

03

GPT-5.6 Luna: la generación anterior

Oficial de $0.20 de entrada y $1.20 de salida por 1M de tokens. GPT-6 Luna reduce a la mitad el precio oficial de entrada y rebaja la salida a menos de la mitad, en la misma categoría de bajo coste.

04

Cómo elegir

Prueba tu registro más complejo en ambos niveles en el playground de arriba. Si la respuesta de Luna es suficiente, la diferencia de 20 veces significa que Sol debe justificar la diferencia en esa tarea específica y no solo por reputación.

Preguntas frecuentes sobre GPT-6 Luna

Preguntas comunes sobre el playground en línea, los precios y el acceso a la API.

/ 01

¿Cuándo debería elegir GPT-6 Luna?

Elija Luna para trabajos bien definidos y de alto volumen, como resúmenes, extracción y clasificación. Escale a GPT-6 Sol solo cuando una tarea requiera un razonamiento insignia.

/ 02

¿Cuánto cuesta GPT-6 Luna en AIReiter?

AIReiter cobra el 30 % de las tarifas oficiales de OpenAI: $0.03 por 1M de tokens de entrada y $0.15 por 1M de tokens de salida, frente a los oficiales $0.10 y $0.50. Las lecturas de entrada en caché cuestan $0.003 por 1M.

/ 03

¿En qué se diferencia GPT-6 Luna de GPT-5.6 Luna?

GPT-6 Luna es la generación más reciente, a la mitad del precio oficial de entrada y una quinta parte del precio oficial de salida de GPT-5.6 Luna, dentro del mismo nivel de rentabilidad.

/ 04

¿Cuál es la ventana de contexto?

GPT-6 Luna admite aproximadamente 1M de tokens de entrada y hasta 128K tokens de salida. Las solicitudes que superen los 272K tokens de entrada se facturan a 2x de entrada y 1.5x de salida, igualando la política de OpenAI.

/ 05

¿Qué tan rápido es GPT-6 Luna?

En AIReiter, una solicitud de resumir y extraer sobre un ticket de soporte de 494 tokens devolvió 204 tokens de salida en 10.6 segundos sin streaming, y de 7.2 a 7.4 segundos de extremo a extremo con streaming. Tenga en cuenta que Luna razona antes de responder: el primer token transmitido tardó entre 5.0 y 5.6 segundos en varias ejecuciones, por lo que la mayor parte de la espera ocurre antes de que aparezca cualquier texto. Reduzca el esfuerzo de razonamiento si necesita que la respuesta comience antes.

/ 06

¿Cuánto cuesta GPT-6 Luna por cada 1,000 registros?

Utilizando esa misma solicitud medida (494 tokens de entrada y 204 de salida), cuesta alrededor de $0.05 por cada 1,000 tickets con las tarifas de AIReiter. La misma carga de trabajo en GPT-6 Sol cuesta aproximadamente $0.91 por cada 1,000.

/ 07

¿Puedo llamar a GPT-6 Luna a través de una API?

Sí. Siga la documentación de la API enlazada y utilice el ID de modelo gpt-6-luna con el endpoint compatible con OpenAI.