Un modelo de 124.000 millones de parámetros suele ser caro y lento de servir. Ling 3.0 Flash rompe parcialmente esa regla: solo activa unos 5,1B de parámetros por token y, por el momento, se puede usar gratis.
inclusionAI lo lanzó el 23 de julio de 2026 como un modelo Mixture-of-Experts (MoE) con razonamiento híbrido, pensado para agentes que programan, usan herramientas, investigan y resuelven tareas de larga duración.
Qué es Ling 3.0 Flash
Ling 3.0 Flash es obra de inclusionAI, el grupo de investigación responsable de las familias de modelos Ling y Ring de Ant Group. Ant Group es la compañía fintech detrás de Alipay. La denominación “Flash” identifica su gama rápida y eficiente en costes, situada por debajo de los modelos insignia, bastante más grandes, del grupo.
Se trata de un modelo de Mixture-of-Experts: de sus 124B de parámetros totales, solo se activan unos 5,1B para cada token. El resultado es un funcionamiento más cercano, en velocidad y coste, al de un modelo pequeño.
También incorpora razonamiento híbrido: responde de forma directa a las peticiones sencillas y pasa a un modo de reflexión más extenso cuando el problema lo exige. inclusionAI lo orienta a “agentes a escala de producción”: cargas de trabajo que invocan herramientas, navegan, escriben y ejecutan código, y mantienen el estado durante numerosos pasos.
La clave está en reducir el cómputo activo
La comparación con Ling 2.6 Flash deja clara la apuesta. El número total de parámetros sube de 104B a 124B, mientras que los parámetros activos bajan de 7,4B a 5,1B.
Más parámetros totales implican mayor capacidad para almacenar conocimiento. Menos parámetros activos reducen el coste de generar cada token. En la práctica, se paga aproximadamente la inferencia de un modelo de unos 5B, pero se aprovecha una capacidad de 124B.
Esto cobra especial importancia en los agentes. Si una tarea consume miles de tokens a través de múltiples llamadas a herramientas, el coste por token termina dominando la factura. En ese escenario, recortar parámetros activos puede ser más valioso que presumir de un tamaño total mayor.
Por dentro utiliza una pila híbrida de atención lineal. inclusionAI describe un bloque recurrente de cinco capas KDA, de atención lineal, por cada capa de atención completa MLA. La atención lineal abarata el procesamiento de entradas largas, mientras que la capa periódica de atención completa conserva la recuperación precisa que los modelos puramente lineales pierden. Así Flash puede trabajar con un contexto nativo de 256K, con margen para llegar a 1M. Los routers lo muestran como 262K, que corresponde al recuento exacto de 262.144 tokens.
Diseñado para agentes, no para conversación abierta
Flash está ajustado para trabajo agéntico, no para chat sin una tarea definida. El anuncio de inclusionAI destaca una mayor precisión al llamar herramientas, más estabilidad en tareas de horizonte largo y mejor compatibilidad con frameworks habituales para agentes. Las demostraciones de lanzamiento van en esa dirección: una ciudad 3D en Blender, investigación multiagente, tareas de Office mediante MCP y aplicaciones de navegador.
En programación, inclusionAI lo posiciona para razonamiento espacial y estructural —cuadrículas de escenas y posiciones relativas— además de la generación de código convencional.
Conviene matizar los benchmarks: el modelo apenas tiene unos días de vida, por lo que las cifras disponibles son afirmaciones de inclusionAI y pruebas tempranas de la comunidad, no evaluaciones independientes. inclusionAI sostiene que Flash iguala o supera a su modelo insignia de unos 1 billón de parámetros en numerosas tareas, con una fracción de los parámetros activos, y su tabla de resultados le atribuye un 56,63 en SWE-Bench Pro con el modo de razonamiento. Hasta que terceros lo confirmen, conviene tratar estos números como datos del proveedor.
Cómo probar Ling 3.0 Flash gratis ahora mismo
La vía más rápida es OpenRouter. El modelo aparece como inclusionai/ling-3.0-flash, con precio de lanzamiento de $0 de entrada y $0 de salida, gratis hasta el 3 de agosto de 2026 (precios comprobados el 24 de julio de 2026). También está disponible sin coste en ZenMux. Ambos ofrecen una API compatible con OpenAI.
Una llamada mínima sería esta:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
Cualquier cliente que ya use chat/completions funcionará al cambiar la URL base, la clave y el identificador del modelo. Un router de modelos también permite hacer pruebas A/B de Ling 3.0 Flash frente a tu modelo actual con los mismos prompts, sin reescribir nada.
Hay dos aspectos que conviene tener en cuenta. La ventana gratuita es promocional, así que cabe esperar precios medidos tras los primeros días de agosto. Como referencia, Ling 2.6 Flash cuesta aproximadamente $0.01 de entrada y $0.03 de salida por millón de tokens. Además, en el lanzamiento solo un proveedor servía el modelo, por lo que el rendimiento y la disponibilidad dependen de ese único backend.
¿Se pueden descargar los pesos?
Aquí es donde las búsquedas de “Ling 3.0 flash download” y “Ling 3.0 flash github” se topan con un límite. En el lanzamiento, los pesos no se publicaron. Por ahora, Flash solo se ofrece mediante API.
Es un cambio respecto a la generación anterior: Ling 2.6 Flash se lanzó con pesos abiertos en Hugging Face, así que hoy es posible ejecutarlo en local. Con Flash 3.0, no.
Si necesitas autoalojarlo o cuantizarlo para tu propio hardware, vigila la página de inclusionAI en Hugging Face: allí están los pesos de 2.6 y allí aparecería una versión 3.0 si el grupo repite su patrón. Hasta entonces, los routers de API anteriores son la única puerta de entrada.
Ling 3.0 Flash frente a Ling 2.6 Flash
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| Lanzamiento | 23 jul 2026 | 21 abr 2026 |
| Parámetros totales | 124B | 104B |
| Activos por token | ~5,1B | ~7,4B |
| Ventana de contexto | 256K nativo (262K en routers) | 256K (262K en routers) |
| Pesos abiertos | No en el lanzamiento | Sí (Hugging Face) |
| Precio de lanzamiento | Gratis hasta el 3 ago 2026 | ~$0.01 entrada / $0.03 salida por 1M |
| Enfoque | Agentes con razonamiento híbrido, uso de herramientas y programación | Modelo instruct rápido para agentes |
En resumen: 3.0 Flash reduce una parte del cómputo activo para ganar capacidad total y añade un modo de razonamiento híbrido, al tiempo que adopta una distribución centrada en API. Si necesitas específicamente pesos locales y sin conexión, 2.6 Flash sigue siendo la versión descargable.
Preguntas frecuentes
¿Ling 3.0 Flash es gratis?
Sí, por ahora. Es gratuito en OpenRouter hasta el 3 de agosto de 2026 y también en ZenMux. Cuando termine esa ventana, cabe esperar precios medidos.
¿Ling 3.0 Flash es open source? ¿Puedo descargarlo o encontrarlo en GitHub?
No en el lanzamiento. No se han publicado pesos, así que solo está disponible mediante API, sin descarga ni repositorio. Puedes usar OpenRouter (inclusionai/ling-3.0-flash) o ZenMux. El anterior Ling 2.6 Flash está abierto en Hugging Face, por lo que unos posibles pesos de 3.0 probablemente aparecerían allí.
¿Ling 3.0 Flash es un modelo chino?
Sí. Lo desarrolla inclusionAI, el grupo de investigación en IA vinculado a Ant Group, la fintech china detrás de Alipay.
¿Qué tamaño tiene Ling 3.0 Flash?
Tiene 124B de parámetros totales y unos 5,1B activos por token gracias a su diseño MoE. Su contexto nativo es de 256K y inclusionAI afirma que escala hacia 1M.
Ling 3.0 Flash vs Ling 2.6 Flash: ¿cuál debería usar?
Elige 3.0 Flash para trabajo con agentes de razonamiento híbrido y un menor coste por token mediante API. Elige 2.6 Flash si necesitas descargar los pesos y ejecutarlo localmente, ya que 3.0 todavía no es abierto.
