Solo tres semanas separan a Gemini 3.6 Flash de Gemini 3.7 Flash, pero el salto en capacidades no es menor: en DeepSWE v1.1 pasa del 48,6% al 65,3%. Ambos mantienen el precio introductorio de $0.75/$3.75 por millón de tokens hasta diciembre de 2026, así que migrar no encarece cada token. Eso sí: el beneficio depende mucho del tipo de carga de trabajo.
Gemini 3.7 Flash frente a 3.6 Flash: los 18 benchmarks
Los resultados de la página oficial de modelos de Google DeepMind reflejan mejoras generalizadas en 3.7 Flash. Las diferencias más marcadas aparecen en benchmarks de agentes de programación y automatización empresarial. La siguiente tabla reúne las 18 métricas que Google publica para ambos modelos; Claude Sonnet 5 y GPT-5.6 Terra se incluyen como referencia.
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Diferencia |
|---|---|---|---|
| Artificial Analysis Intelligence Index (compuesto) | 56 | 52 | +4 |
| FrontierCode 1.1 (calidad de código de producción) | 43.6% | 34.4% | +9.2 |
| DeepSWE v1.1 (ingeniería de software de largo alcance) | 65.3% | 48.6% | +16.7 |
| Code Arena (Elo de desarrollo web) | 1588 | 1538 | +50 |
| Terminal-Bench 2.1 (programación en terminal con agentes) | 85.8% | 78.0% | +7.8 |
| Terminal-Bench 3.0 (capacidades generales de agentes) | 14.9% | 5.4% | +9.5 |
| AutomationBench (automatización de flujos empresariales) | 30.4% | 17.0% | +13.4 |
| GDPVal-AA v2 (Elo de trabajo de conocimiento) | 1525 | 1422 | +103 |
| Harvey LAB-AA (flujos jurídicos complejos) | 90.7% | 85.1% | +5.6 |
| GDP.pdf (comprensión experta de PDF) | 34.0% | 22.0% | +12.0 |
| CharXiv, sin herramientas (razonamiento sobre gráficos) | 84.5% | 85.2% | −0.7 |
| CharXiv, con herramientas | 88.7% | 89.4% | −0.7 |
| LVBench (comprensión de vídeo largo) | 85.4% | 84.2% | +1.2 |
| GDM-MRCR v2, 128k (recuperación en contexto largo) | 97.0% | 91.8% | +5.2 |
| OSWorld-2.0 (uso de ordenador con agentes) | 47.9% | 33.8% | +14.1 |
| Agent's Last Exam (tareas de agentes de escritorio) | 26.3% | 24.2% | +2.1 |
| HLE-Verified (razonamiento experto multidisciplinar) | 53.6% | 51.2% | +2.4 |
| LABBench2 (tareas de investigación en biología) | 82.1% | 76.1% | +6.0 |
Todas las cifras han sido comunicadas por Google DeepMind en la página de 3.7 Flash. La mayoría de estos benchmarks aún no cuenta con reproducciones independientes publicadas, así que conviene interpretar las diferencias como una orientación y no como una garantía para tu caso de uso.
Programación y agentes: el gran avance de 3.7 Flash
Las mayores distancias entre ambos modelos se concentran en programación y tareas de agentes. DeepSWE v1.1, que mide ingeniería de software de largo alcance sobre tareas reales de repositorios, gana 16,7 puntos porcentuales: del 48,6% al 65,3%. En esa misma métrica supera a Claude Sonnet 5, con un 53,8%, y queda entre este y GPT-5.6 Terra, que alcanza el 69,6% (todas las puntuaciones comparativas proceden de la tabla de benchmarks de DeepMind).
El patrón se repite en otros benchmarks centrados en agentes:
- Terminal-Bench 3.0 (capacidades de agentes con múltiples herramientas): del 5,4% al 14,9%, casi se triplica
- AutomationBench (automatización de flujos empresariales): del 17,0% al 30,4%
- FrontierCode 1.1 (calidad de código de producción): +9,2 puntos
- OSWorld-2.0 (uso de ordenador con agentes): del 33,8% al 47,9%
Las primeras opiniones de usuarios en Reddit ilustran bien la distancia entre ganar benchmarks y la experiencia cotidiana de desarrollo:
Es eficaz para implementar, pero puede rendir peor en planificación, revisión de código y descomposición de problemas difíciles.
— Debate de usuarios en r/google_antigravity
Los datos de clientes publicados por Google en la página del modelo de DeepMind van en la misma dirección. Browser Use informó de que "el agente Gemini 3.7 Flash fue un 35% más barato que 3.6 Flash, con un +8% observado en la tasa de aciertos de caché de prompts y menos errores de herramientas". Harvey midió una mejora de 2,6 puntos en la tasa de aprobación total de Legal Agent Bench. Nunu.ai obtuvo un rendimiento comparable al de GPT-5.6-Terra "a aproximadamente la mitad del coste". Los tres atribuyen el ahorro a menos pasos en el bucle del agente, no a descuentos por token.
Trabajo de conocimiento y multimodalidad: mejoras más contenidas, pero reales
Fuera de la programación, las mejoras son más moderadas. El Artificial Analysis Intelligence Index pasa de 52 a 56, situando a 3.7 Flash entre Claude Sonnet 5, con 55, y GPT-5.6 Terra, con 57, según la tabla comparativa de DeepMind. El mayor avance ajeno al código está en la comprensión documental: GDP.pdf sube del 22,0% al 34,0%, una ganancia de 12 puntos para pipelines que procesan documentos complejos, informes financieros o expedientes jurídicos. GDM-MRCR v2, que mide la recuperación de información en contextos de 128K tokens, mejora del 91,8% al 97,0%.
Harvey LAB-AA, que evalúa flujos jurídicos complejos, pasa del 85,1% al 90,7%. La comprensión de vídeo largo con LVBench y las tareas de investigación biológica de LABBench2 también mejoran en torno a 6 puntos. Son avances relevantes para cargas especializadas, aunque por sí solos difícilmente justificarán una actualización.
Precios: la tarifa introductoria es idéntica
| Modelo | Entrada ($/1M de tokens) | Salida ($/1M de tokens) | Tarifa estándar (desde el 1 de enero de 2027) |
|---|---|---|---|
| Gemini 3.7 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Gemini 3.6 Flash | $0.75\* | $3.75\* | $1.50 / $7.50 |
| Claude Sonnet 5 | $2.00 | $10.00 | — |
| GPT-5.6 Terra | $2.00 | $12.00 | — |
\*El precio introductorio vence el 31 de diciembre de 2026. Todos los precios proceden de la página del modelo de DeepMind.
Cuando lanzó 3.7 Flash el 13 de agosto de 2026, Google aplicó a ambos modelos Flash la tarifa promocional de $0.75/$3.75. Antes de ello, 3.6 Flash tenía su tarifa estándar de $1.50/$7.50. A partir del 1 de enero de 2027, ambos volverán a $1.50/$7.50 salvo que Google prorrogue la promoción. Con el mismo precio por token, la diferencia de coste depende de la eficiencia en la tarea: la reducción del 35% en el coste de agentes que reportó Browser Use se midió sobre las mismas cargas de trabajo y se atribuyó a menos llamadas a herramientas y más aciertos de caché, no a una tarifa distinta.
Para consultar un desglose detallado de los costes de la API de 3.7 Flash, incluidos caché, Batch API y cargos de grounding, revisa nuestra guía de precios de la API de Gemini 3.7 Flash.
Los casos en los que 3.6 Flash aún es mejor
3.6 Flash conserva una ligera ventaja en razonamiento sobre gráficos. En CharXiv sin herramientas, 3.6 obtiene un 85,2% frente al 84,5% de 3.7. Con las herramientas activadas, la diferencia es idéntica: 89,4% frente a 88,7%. Al ser márgenes inferiores a un punto, ambos modelos pueden rendir de forma muy similar en tareas individuales con gráficos. Antes de elegir un modelo predeterminado, valida ambos con tu propia carga de trabajo.
Ningún otro benchmark de la tabla comparativa de Google muestra a 3.6 por delante de 3.7. La diferencia en el índice de inteligencia, 52 frente a 56, es el terreno más disputado fuera del razonamiento gráfico, pero incluso ahí lidera 3.7.
Migración: más allá de cambiar el nombre del modelo
La migración mecánica consiste en sustituir el ID gemini-3.6-flash por gemini-3.7-flash. Según la página del modelo de DeepMind, ambos comparten la misma ventana de contexto, con 1M de entrada y 64K de salida; las mismas modalidades de entrada —texto, imagen, vídeo, audio y PDF—; y las mismas capacidades de uso de herramientas, como function calling, search grounding y computer use. La página cataloga 3.7 Flash como disponibilidad general.
Hay una salvedad importante: la transición de 3.5 a 3.6 introdujo cambios silenciosos en el comportamiento de la API que sorprendieron a muchos desarrolladores. Como documentaron pruebas independientes, temperature, top_p y top_k pasaron a ignorarse sin aviso; thinking_budget se convirtió en el enum de cadena thinking_level; y se eliminó el prefilling de respuestas. Google aún no ha publicado si 3.7 Flash incorpora cambios similares. Hasta que exista esa documentación, ejecuta tu suite de evaluación con ambos IDs antes de migrar tráfico de producción. Mantén 3.6 disponible como alternativa.
¿Conviene cambiar a 3.7 Flash?
La decisión depende del tipo de carga de trabajo:
- Cambia ya si ejecutas agentes de programación. DeepSWE v1.1 gana 16,7 puntos y Terminal-Bench 3.0 casi se triplica. Con el mismo precio por token, no hay una razón económica para seguir con 3.6 en cargas de trabajo de agentes de código.
- Cambia ya si procesas documentos complejos. La comprensión en GDP.pdf aumenta 12 puntos, del 22,0% al 34,0%. La recuperación en contextos de 128K tokens alcanza un 97,0%, casi perfecta.
- Prueba antes si tu tarea principal es razonar sobre gráficos. Las puntuaciones de CharXiv favorecen a 3.6 por menos de un punto. Haz una evaluación comparativa antes de decidirte.
- Mantente en 3.6 si tu pipeline está validado y es estable. La página del modelo de DeepMind no indica una fecha de retirada para 3.6 Flash. Si tu flujo supera las pruebas de regresión y no necesitas de inmediato las mejoras de programación, depurar cambios de comportamiento puede costar más que el beneficio. Migra un flujo cada vez.
- Ten en cuenta el ritmo de lanzamientos. Google publicó 3.7 apenas tres semanas después de 3.6. Migra ahora los flujos en los que 3.7 ofrece las mayores mejoras, conserva 3.6 fijado como alternativa y trata cada lanzamiento de Flash como una actualización incremental que hay que evaluar, no como un cambio de plataforma.
Puedes comparar ambos modelos en paralelo mediante las interfaces de chat de Gemini 3.7 Flash y Gemini 3.6 Flash.
¿Gemini 3.7 Flash usa una arquitectura nueva o es una actualización posterior al entrenamiento?
Google no ha descrito públicamente 3.7 Flash ni como una arquitectura nueva ni como un parche posterior al entrenamiento. El Artificial Analysis Intelligence Index pasa de 52 a 56, mientras que unas pruebas independientes confirmaron que 3.5 y 3.6 Flash obtuvieron ambos 50 en el mismo índice. No hay documentación que aclare si la mejora de 3.7 responde a cambios arquitectónicos o a mejores datos de entrenamiento.
¿Gemini 3.7 Flash cuesta más que 3.6 Flash?
No. Ambos modelos tienen el mismo precio de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026. Después, los dos pasarán a $1.50/$7.50. El ahorro de actualizar procede de necesitar menos llamadas a herramientas y menos pasos de razonamiento por tarea, no de un precio inferior por token.
¿Dónde está disponible Gemini 3.7 Flash?
Según la página del modelo de DeepMind, 3.7 Flash está disponible a través de Gemini API, Google AI Studio, Google Antigravity, Vertex AI, Gemini Enterprise y la Gemini App, con estado de disponibilidad general.
¿Debería esperar a la próxima versión de Flash en lugar de migrar ahora?
3.7 Flash es un modelo GA con benchmarks publicados y adopción por parte de clientes. Si tu carga de trabajo se beneficia de las mejoras en programación y agentes, migra esos flujos ahora y vuelve a evaluarlos cuando llegue la próxima versión. Esperar tiene un coste de oportunidad: renuncias a mejoras que ya puedes aprovechar.