Un agente con Gemini 3.8 Flash puede parecer barato a $0.75 por millón de tokens de entrada, pero esa es solo la tarifa introductoria. Google indica que las tarifas estándar se duplicarán a partir del 1 de enero de 2027, y los tokens de razonamiento junto con los reintentos pueden elevar el coste de cada tarea aceptada. Para hacer presupuesto, toma como referencia la tarifa de enero y tu tasa de éxito, no el precio por token de hoy.
La métrica que importa al crear agentes
La cifra relevante no es el coste por llamada a la API, sino el coste por tarea completada con éxito: todo el gasto en modelo y herramientas dividido entre las ejecuciones que superan tu prueba de aceptación.
Gemini 3.8 Flash tiene más sentido en trabajos complejos y de varios pasos, cuando el razonamiento adicional evita reintentos o mejora los resultados aceptados. No debería ser la opción predeterminada para todas las rutas de extracción con formato fijo o clasificación sencilla.
“if you're picking flash for agent loops, price the jan bill, not today's api page.” — Vraj (@vraj_ai), 3 de septiembre de 2026
Tarifas de Gemini 3.8 Flash desde el 1 de enero de 2027
La documentación de precios de Gemini API de Google y la documentación del modelo recogen tarifas introductorias hasta el 31 de diciembre de 2026. Las tarifas estándar entran en vigor el 1 de enero de 2027.
| Modalidad de facturación | Entrada hasta el 31 dic. 2026 | Salida hasta el 31 dic. 2026 | Entrada desde el 1 ene. 2027 | Salida desde el 1 ene. 2027 |
|---|---|---|---|---|
| Estándar | $0.75 / 1M | $3.75 / 1M | $1.50 / 1M | $7.50 / 1M |
| Batch | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Flex | $0.375 / 1M | $1.875 / 1M | $0.75 / 1M | $3.75 / 1M |
| Priority | $1.35 / 1M | $6.75 / 1M | $2.70 / 1M | $13.50 / 1M |
| Entrada en caché | $0.075 / 1M | — | $0.15 / 1M | — |
Son tarifas por token, no la factura completa de un agente. Grounding documentado, almacenamiento de caché, herramientas externas, hosting y comisiones del proveedor pueden añadir cargos. La facturación de salida incluye los tokens de pensamiento, no solo la respuesta visible.
Batch es la palanca de presupuesto más útil para trabajos que toleran espera. Tras el cambio, su precio será igual al precio Standard actual, siempre que la carga de trabajo cumpla los requisitos y la superficie de API aplique realmente la tarifa Batch.
Cómo calcular el coste por tarea aceptada
En lugar de limitarte a multiplicar tokens, calcula estas cuatro capas:
- Coste del modelo por intento =
(tokens de entrada × tarifa de entrada) + (tokens de salida × tarifa de salida). - Coste por intento = coste del modelo más cargos de herramientas, grounding, almacenamiento e infraestructura.
- Coste esperado por tarea completada = coste por intento ÷ probabilidad de éxito.
- Coste observado por tarea completada = gasto total ÷ tareas aceptadas.
En un bucle de agente, cuenta cada turno del modelo y cada reintento. Si una ejecución hace tres llamadas antes de devolver una respuesta, sus tokens de entrada y salida son la suma de las tres llamadas. Incluye los tokens de pensamiento dentro del uso de salida; Google expone campos de uso como promptTokenCount, thoughtsTokenCount y candidatesTokenCount en las respuestas de Gemini.
Ejemplo: 20.000 tokens de entrada y 5.000 de salida
Supón que un intento completo consume 20.000 tokens de entrada y 5.000 tokens de salida. En este ejemplo se excluyen los cargos de herramientas.
| Periodo | Cálculo | Coste por intento | Con un 70% de éxito, coste por tarea completada |
|---|---|---|---|
| Hasta el 31 dic. 2026 | 0.02 × $0.75 + 0.005 × $3.75 | $0.03375 | $0.0482 |
| Desde el 1 ene. 2027 | 0.02 × $1.50 + 0.005 × $7.50 | $0.06750 | $0.0964 |
El cambio de tarifas duplica el coste si el uso de tokens y la probabilidad de éxito se mantienen constantes. Si el agente reintenta una vez ante algunos fallos, la media real superará esta estimación simple, porque los intentos fallidos también consumen tokens.
El denominador es decisivo. Un agente que cuesta $0.05 por llamada pero solo acierta en la mitad de las ejecuciones cuesta $0.10 por tarea aceptada antes de los cargos de herramientas; una llamada de $0.08 con un 90% de éxito cuesta aproximadamente $0.0889 por tarea aceptada.
Tres escenarios que cambian el presupuesto
Extracción con estructura fija
Una ruta de PDF a JSON con un esquema estable suele tener una prueba de aceptación clara: los campos obligatorios están presentes, los tipos validan y no aparece texto adicional. Empieza con pensamiento low y mide si la tarea pasa. Pagar por esfuerzo high cuando la validación ya se supera añade coste sin mejorar el denominador.
La documentación del modelo de Google describe los niveles de pensamiento low, medium y high para Gemini 3.8 Flash; minimal no es compatible. Conviene tratar el nivel de pensamiento como un ajuste de coste por ruta, no como un valor predeterminado para toda la aplicación.
Trabajo de agente con contexto largo
Un agente de programación o investigación puede reproducir un contexto extenso durante varios turnos y, después, generar más razonamiento y llamadas a herramientas. En este caso, la entrada en caché, menos reintentos y una mayor tasa de éxito pueden importar más que la tarifa nominal de salida.
Para una tarea de larga duración, registra por separado la repetición del contexto y la entrada nueva. Una ventana de contexto de 1 millón de tokens no vuelve gratuitos esos tokens. Si la ruta es interactiva, Standard o Priority pueden ser adecuados; si puede ejecutarse durante la noche, compara Batch o Flex con el requisito de tiempo.
Automatización con muchos reintentos
Supón que una ruta cuesta $0.0675 por intento a partir del 1 de enero y tiene una tasa de éxito del 70%. Asumiendo reintentos independientes y sin límite de reintentos, los intentos esperados por éxito son aproximadamente 1 ÷ 0.70 = 1.43, es decir, unos $0.0964 de coste de modelo por tarea aceptada.
Si los fallos activan acciones costosas en el navegador, llamadas de búsqueda o revisión humana, suma esos costes al numerador. Un agente puede ser barato en tokens y caro de operar.
Cuándo Gemini 3.8 Flash justifica el sobrecoste
Usa Gemini 3.8 Flash cuando el razonamiento adicional cambie el resultado: menos parches rechazados, menos secuencias de herramientas fallidas, mejor verificación en varios pasos o una mayor tasa de aceptación en tareas difíciles. Mantén una ruta más económica para transformaciones repetitivas, enrutamiento, extracción y otros trabajos cuyas pruebas de aceptación ya superen un nivel de esfuerzo bajo.
Las cifras independientes publicadas por Artificial Analysis y resumidas por Apidog sitúan a Gemini 3.8 Flash en aproximadamente $0.58 por tarea de benchmark con una configuración de pensamiento alto, frente a unos $0.40 para Gemini 3.7 Flash, con una puntuación de 59 frente a 56 en el Intelligence Index. Son cifras específicas de esos benchmarks, no una previsión universal de factura; úsalas como evidencia de que el consumo de tokens puede cambiar la economía, no como una cotización para tu carga de trabajo.
Los informes de la comunidad apuntan en la misma dirección. Jan (@jan_volad) comunicó aproximadamente 120 millones de tokens de salida para una comparación de Gemini 3.8 Flash, frente a 29–35 millones para competidores, y describió un coste combinado por tarea de $0.58; es una observación de un usuario, no una factura de producción auditada de forma independiente. La publicación resulta útil porque ilustra por qué una tarifa baja por millón de tokens puede exagerar el ahorro.
Una regla práctica de enrutamiento sería:
- Tarea de agente compleja: prueba Gemini 3.8 Flash con
mediumohighy mide el coste por tarea aceptada. - Tarea rutinaria: prueba primero
low; conserva la ruta solo si supera su control de calidad. - Trabajo masivo que tolera espera: compara Batch con Standard después del 1 de enero.
- Cualquier ruta con calidad incierta: no optimices la tarifa por token antes de medir la probabilidad de éxito.
Preguntas frecuentes sobre los precios de Gemini 3.8 Flash
¿Batch siempre es más barato?
Batch es más barato según la tabla de tarifas publicada, pero está pensado para cargas de trabajo que pueden tolerar procesamiento diferido. No sustituye directamente a un agente interactivo que debe responder de inmediato.
¿Cómo calculo el coste por tarea de agente completada con éxito?
Suma los cargos de modelo, herramientas, grounding e infraestructura durante el periodo de ejecución, y divídelos entre las ejecuciones que superan tu prueba de aceptación. Para una previsión, divide el coste esperado por intento entre la probabilidad de éxito estimada e incluye los reintentos previstos.
Conclusión práctica: presupuesta la ruta, no el modelo
Registra por ruta la entrada, el pensamiento, la salida visible, los turnos de herramientas, los reintentos, la latencia, el gasto y el estado de aceptación. Prueba los niveles de pensamiento relevantes y proyecta tanto la tabla de tarifas de diciembre como la de enero.
La decisión es sencilla: usa Gemini 3.8 Flash cuando el razonamiento adicional compre resultados satisfactorios, utiliza menor esfuerzo para trabajos que ya pasan y desplaza a Batch los trabajos masivos que cumplan los requisitos. El cambio de tarifas de enero de 2027 figura actualmente en la tabla publicada; que el modelo resulte económico dependerá de los tokens y los fallos que haya detrás de cada resultado aceptado.