Thinking Machines Inkling: 975B, abierto y difícil de ejecutar

Última actualización: 2026-07-16 10:38:37

Thinking Machines Inkling es un modelo de peso abierto de 975 mil millones de parámetros lanzado el 15 de julio de 2026, construido como una mezcla escasa de expertos que activa solo 41 mil millones de parámetros por token y admite entrada de texto, imagen y audio. Se distribuye bajo Apache-2.0, así que puedes descargar los pesos completos y ajustarlo comercialmente. La pega: incluso una cuantización de 4 bits necesita aproximadamente 600 GB de VRAM, así que este es un modelo que los equipos evalúan en un clúster, no algo que ejecutes en una GPU para gaming.

Las especificaciones y en qué se equivocaron los titulares

Aquí está lo que indican la tarjeta del modelo de Hugging Face y la página oficial de Inkling (accedido el 16 de julio de 2026).

EspecificaciónInkling
Parámetros totales975B
Parámetros activos41B por token
Arquitectura66 capas solo decodificador, MoE disperso (256 expertos, 6 enrutados + 2 compartidos)
ModalidadesTexto, imagen, audio de entrada; texto de salida (UTF-8)
Datos de entrenamiento45 billones de tokens
LicenciaApache-2.0
DescargaHugging Face (thinkingmachines/inkling)

Tres cosas que circulan en la cobertura del lanzamiento necesitan corrección:

  • Ventana de contexto. Varias reseñas citaron una ventana de 1M de tokens. La página oficial de Inkling indica 64K estándar, y 256K cuando se ejecuta a través de la plataforma Tinker; la tarjeta de Hugging Face no especifica ningún número. Tome 64K/256K como las cifras que puede verificar y 1M como no confirmado.
  • Licencia. Está confirmado que es Apache-2.0, una de las licencias más permisivas disponibles, y permite el uso comercial. Thinking Machines sí pone en usted la responsabilidad de la seguridad del ajuste fino.
  • "Inkling-Small." Una variante más pequeña con ~12B parámetros activos apareció en algunos informes, pero no figura en la tarjeta del modelo de Hugging Face. Hasta que aparezca allí, no cuente con ella.

Qué significa realmente "975B parameters" aquí

Inkling enruta cada token a 6 de 256 expertos más 2 expertos compartidos, así que solo alrededor de 41B parámetros se activan a la vez aunque el conjunto completo sea de 975B. Por eso Thinking Machines afirma que iguala a Nemotron 3 Ultra de Nvidia en programación mientras gasta aproximadamente un tercio menos de tokens para lograrlo: obtienes la amplitud de un modelo grande al costo de inferencia de un modelo de tamaño medio.

Inkling también expone un dial de "thinking effort". Súbelo para problemas más difíciles y acepta respuestas más lentas y deliberadas, o bájalo para mayor velocidad. Está entrenado para señalar la incertidumbre en lugar de adivinar, lo cual importa más para una base de fine-tuning que para un chatbot de consumo.

¿Puedes realmente ejecutar Inkling?

Aquí es donde la etiqueta "open weights" se complica, porque open no significa ligero. Esto es más o menos lo que se necesita para servir el modelo completo de 975B, según la model card y las primeras estimaciones de la comunidad (estas son aproximaciones, no garantías):

Approximate VRAM required to run Inkling at different quantization levels
  • BF16 (precisión completa): ~2TB de VRAM solo para los pesos, así que 16+ GPUs de clase H200, o un nodo B300 de 8 GPUs, antes de añadir la sobrecarga de servicio.
  • NVFP4 / 4 bits: ~600GB, todavía en territorio de servidor multi-GPU (aproximadamente 4× H200 o 8× tarjetas de 80GB).
  • GGUF de 1-2 bits (llama.cpp / cuantis de Unsloth): ~280-350GB de RAM+VRAM combinadas, alcanzable en una estación de trabajo de gama alta o en un Mac Studio Ultra al máximo, y más lento cuando empujas hacia contextos largos porque la caché KV crece.

La lectura honesta: un equipo bien financiado puede evaluar y ajustar Inkling, pero hoy no existe una vía para ejecutarlo localmente en una GPU de consumo. Si eres un desarrollador independiente que espera cargarlo en una sola tarjeta de 24GB, este no es tu modelo. Lo descargas desde Hugging Face en thinkingmachines/inkling, o lo ajustas a través de la plataforma Tinker de Thinking Machines, que también desbloquea el contexto de 256K.

Dónde se posiciona Inkling frente a otros modelos

Thinking Machines dice abiertamente que Inkling no es el modelo más potente disponible, y las evaluaciones de la tarjeta del modelo lo respaldan: Inkling obtiene buenos resultados, pero queda por detrás de la frontera cerrada en razonamiento y programación.

Inkling benchmark scores compared with the best rival on each test
BenchmarkInklingMejor rival citado
AIME 202697.1%GPT 5.6 Sol, 99.9%
SWE-bench Verified77.6%Claude Fable 5, 95.0%
MMMU Pro73.3%Claude Fable 5, 84.2%
VoiceBench91.4%Gemini 3.1 Pro, 94.3%

*Fuente: ficha del modelo Inkling y página oficial de benchmarks, consultadas el 16 de julio de 2026.*

El gráfico de radar oficial cuenta la misma historia visualmente. Inkling se defiende bien en tareas de razonamiento y multimodales, pero queda por detrás de GPT 5.6 Sol y Claude Fable 5 en programación agéntica (SWE-bench Pro, Terminal Bench).

Official Inkling benchmark radar comparing it with GPT 5.6 Sol and Claude Fable 5

Donde destaca es en su amplitud: comprensión nativa de audio e imágenes en un solo modelo abierto, con una brecha en programación que puedes reducir mediante fine-tuning. Si necesitas el mejor agentic coding de su clase listo para usar, un modelo frontier cerrado sigue ganando. Si necesitas una base multimodal abierta que poseas, Inkling es la opción más interesante.

Para quién es realmente Inkling

Inkling es una base sobre la que construir, no un asistente terminado. Thinking Machines gana dinero con Tinker, su plataforma de fine-tuning, no con llamadas API medidas, así que el modelo en sí es gratuito y la propuesta es "toma esto y especialízalo."

La prueba más clara es Bridgewater Associates: según Thinking Machines, una versión del modelo ajustada para finanzas obtuvo un 84.7% en la prueba de razonamiento de la firma, a aproximadamente una catorceava parte del costo de un modelo propietario. Ese es el uso previsto: un generalista capaz que un equipo adapta para un dominio específico.

Así que encaja si tienes la infraestructura y la experiencia en fine-tuning para especializar un modelo abierto y quedarte con el resultado, y puedes aceptar la responsabilidad del safety tuning. Pásalo por alto si quieres un chatbot listo para usar o si trabajas con hardware de consumo, porque los modelos cerrados de propósito general son más baratos de alcanzar y más potentes desde el primer día. Una salvedad que conviene conocer: el post-training de Inkling utilizó datos generados por otros modelos abiertos, incluido Kimi K2.5 de Moonshot, y Thinking Machines dice que su próxima generación estará entrenada por completo con datos propios.

Preguntas frecuentes sobre Inkling

¿Inkling es gratuito para uso comercial?

Sí. Se publica bajo Apache-2.0, lo que permite el uso comercial y la modificación. Usted es responsable de cualquier ajuste fino de seguridad antes de implementarlo.

¿Dónde puedo descargar Inkling?

Los pesos completos están en Hugging Face en thinkingmachines/inkling. También aparecen allí versiones GGUF cuantizadas de la comunidad.

¿Inkling realmente tiene una ventana de contexto de 1M tokens?

La página oficial indica 64K por defecto y 256K a través de la plataforma Tinker. La cifra de 1M en algunas coberturas no está confirmada en la ficha del modelo, así que planifica en torno a 64K/256K.

Inkling vs DeepSeek o Qwen, ¿cuál es mejor?

Depende de la tarea, no de una sola puntuación. La ventaja de Inkling es su entrada multimodal nativa (texto, imagen, audio) en un solo modelo Apache-2.0, además de la ruta de fine-tuning Tinker; los principales modelos abiertos chinos siguen siendo opciones sólidas para uso general y programación. Evalúalos en tu propia tarea antes de comprometerte.

¿Qué es Tinker y lo necesito?

Tinker es la plataforma de fine-tuning alojada de Thinking Machines. No la necesitas para ejecutar los open weights, pero es la vía oficial para personalizar Inkling y eleva la ventana de contexto a 256K.

---

Lectura relacionada