Thinking Machines Inkling est un modèle open-weight de 975 milliards de paramètres, publié le 15 juillet 2026, conçu comme un mélange d’experts parcimonieux qui n’active que 41 milliards de paramètres par token et accepte des entrées texte, image et audio. Il est distribué sous Apache-2.0, vous pouvez donc télécharger l’ensemble complet des poids et les affiner à des fins commerciales. Le hic : même une quantification 4 bits nécessite environ 600 Go de VRAM, donc c’est un modèle que les équipes évaluent sur un cluster, pas quelque chose que l’on exécute sur un GPU de jeu.
Les spécifications, et ce que les gros titres ont mal rapporté
Voici ce qu’indiquent la fiche modèle Hugging Face et la page officielle d’Inkling (consultées le 16 juillet 2026).
| Spécification | Inkling |
|---|---|
| Paramètres totaux | 975B |
| Paramètres actifs | 41B par token |
| Architecture | Décoder uniquement à 66 couches, MoE clairsemé (256 experts, 6 routés + 2 partagés) |
| Modalités | Texte, image, audio en entrée ; texte en sortie (UTF-8) |
| Données d'entraînement | 45 billions de tokens |
| Licence | Apache-2.0 |
| Téléchargement | Hugging Face (thinkingmachines/inkling) |
Trois éléments qui circulent dans la couverture du lancement doivent être corrigés :
- Fenêtre de contexte. Plusieurs articles mentionnaient une fenêtre de 1M tokens. La page officielle d’Inkling indique 64K en standard, et 256K lorsqu’elle est exécutée via la plateforme Tinker ; la fiche Hugging Face n’indique aucun chiffre. Considérez 64K/256K comme les valeurs que vous pouvez vérifier, et 1M comme non confirmé.
- Licence. Il s’agit bien d’Apache-2.0, l’une des licences les plus permissives qui soient, et elle autorise l’usage commercial. Thinking Machines vous laisse toutefois la responsabilité de la sécurité du fine-tuning.
- « Inkling-Small ». Une variante plus petite avec environ 12B paramètres actifs est apparue dans certains rapports, mais elle ne figure pas sur la fiche modèle Hugging Face. Tant qu’elle n’y apparaît pas, ne comptez pas dessus.
Ce que « 975B parameters » signifie vraiment ici
Inkling achemine chaque jeton vers 6 des 256 experts plus 2 experts partagés, de sorte qu’environ 41B paramètres seulement s’activent à la fois, même si l’ensemble complet atteint 975B. C’est pourquoi Thinking Machines affirme qu’il égale le Nemotron 3 Ultra de Nvidia en codage tout en dépensant environ un tiers de jetons en moins pour y parvenir : vous obtenez l’ampleur d’un grand modèle au coût d’inférence d’un modèle de taille intermédiaire.
Inkling expose également un cadran de « niveau d’effort de réflexion ». Augmentez-le pour les problèmes plus difficiles et acceptez des réponses plus lentes et plus réfléchies, ou baissez-le pour gagner en vitesse. Il est entraîné à signaler l’incertitude plutôt qu’à deviner, ce qui compte davantage pour une base de fine-tuning que pour un chatbot grand public.
Pouvez-vous réellement exécuter Inkling ?
C’est là que l’étiquette « open weights » se complique, car ouvert ne veut pas dire léger. Voici à peu près ce qu’il faut pour servir le modèle complet de 975B, d’après la model card et les premières estimations de la communauté (ce sont des ordres de grandeur, pas des garanties) :
- BF16 (pleine précision) : ~2 To de VRAM rien que pour les poids, donc 16 GPU de classe H200 ou plus, ou un nœud B300 à 8 GPU, avant d’ajouter la surcharge de service.
- NVFP4 / 4 bits : ~600 Go, toujours dans le domaine des serveurs multi-GPU (environ 4× H200 ou 8× cartes 80 Go).
- GGUF 1-2 bits (llama.cpp / quants Unsloth) : ~280-350 Go de RAM+VRAM combinées, atteignable sur une station de travail haut de gamme ou un Mac Studio Ultra au maximum, et plus lent dès qu’on pousse vers un long contexte parce que le cache KV grossit.
La lecture honnête : une équipe bien financée peut évaluer et affiner Inkling, mais il n’existe pas aujourd’hui de solution pour l’exécuter localement sur un GPU grand public. Si vous êtes un développeur solo qui espère le charger sur une seule carte de 24 Go, ce n’est pas votre modèle. Vous le téléchargez depuis Hugging Face à l’adresse thinkingmachines/inkling, ou vous l’affinez via la plateforme Tinker de Thinking Machines, qui débloque également le contexte de 256K.
Comparaison d'Inkling avec d'autres modèles
Thinking Machines dit clairement qu’Inkling n’est pas le modèle le plus puissant disponible, et la model card le confirme avec les benchmarks : Inkling obtient de bons résultats, mais reste derrière les modèles fermés de pointe en raisonnement et en programmation.
| Benchmark | Inkling | Meilleur concurrent cité |
|---|---|---|
| AIME 2026 | 97.1% | GPT 5.6 Sol, 99.9% |
| SWE-bench Verified | 77.6% | Claude Fable 5, 95.0% |
| MMMU Pro | 73.3% | Claude Fable 5, 84.2% |
| VoiceBench | 91.4% | Gemini 3.1 Pro, 94.3% |
*Source : fiche modèle Inkling et page officielle de référence, consultées le 16 juillet 2026.*
Le graphique radar officiel raconte la même histoire visuellement. Inkling tient bon sur les tâches de raisonnement et multimodales, mais se situe derrière GPT 5.6 Sol et Claude Fable 5 en codage agentique (SWE-bench Pro, Terminal Bench).
Là où il excelle, c’est par son étendue : compréhension native de l’audio et des images dans un seul modèle ouvert, avec un écart en matière de codage que vous pouvez réduire grâce au fine-tuning. Si vous avez besoin du meilleur codage agentique prêt à l’emploi, un modèle frontier fermé reste gagnant. Si vous avez besoin d’une base multimodale ouverte qui vous appartient, Inkling est l’option la plus intéressante.
Pour qui Inkling est réellement conçu
Inkling est une base sur laquelle construire, pas un assistant fini. Thinking Machines gagne de l'argent grâce à Tinker, sa plateforme de fine-tuning, et non grâce à des appels API facturés à l'usage, donc le modèle lui-même est gratuit et l'argument est : « prenez ceci et spécialisez-le. »
La preuve la plus claire est Bridgewater Associates : selon Thinking Machines, une version du modèle optimisée pour la finance a obtenu 84,7 % au test de raisonnement de l’entreprise, pour environ un quatorzième du coût d’un modèle propriétaire. C’est l’usage prévu : un généraliste performant qu’une équipe remodèle pour un domaine spécifique.
C’est donc une bonne option si vous disposez de l’infrastructure et de l’expertise en fine-tuning pour spécialiser un modèle open et en garder la maîtrise, et si vous pouvez assumer la responsabilité du safety tuning. Passez votre chemin si vous voulez un chatbot prêt à l’emploi ou si vous travaillez avec du matériel grand public, car les modèles fermés à usage général sont moins coûteux à atteindre et plus performants dès le départ. Un point à connaître toutefois : le post-training d’Inkling a utilisé des données générées par d’autres modèles open, y compris Kimi K2.5 de Moonshot, et Thinking Machines indique que sa prochaine génération sera entièrement auto-entraînée.
FAQ sur Inkling
Inkling est-il gratuit pour une utilisation commerciale ?
Oui. Il est publié sous Apache-2.0, ce qui autorise l’utilisation commerciale et la modification. Vous êtes responsable de tout affinage de sécurité avant son déploiement.
Où puis-je télécharger Inkling ?
Les poids complets sont sur Hugging Face à l’adresse thinkingmachines/inkling. Des builds GGUF quantifiés de la communauté y apparaissent également.
Inkling dispose-t-il vraiment d'une fenêtre de contexte de 1M de tokens ?
La page officielle indique 64K par défaut et 256K via la plateforme Tinker. Le chiffre de 1M mentionné dans certaines couvertures n’est pas confirmé sur la fiche du modèle, donc prévoyez sur la base de 64K/256K.
Inkling contre DeepSeek ou Qwen, lequel est le meilleur ?
Cela dépend de la tâche, pas d’un score unique. L’avantage d’Inkling réside dans son entrée multimodale native (texte, image, audio) dans un seul modèle Apache-2.0, ainsi que dans le parcours de fine-tuning Tinker ; les principaux modèles chinois open source restent d’excellents choix généraux et pour le code. Évaluez-les sur votre propre tâche avant de vous engager.
Qu'est-ce que Tinker, et en ai-je besoin ?
Tinker est la plateforme de fine-tuning hébergée de Thinking Machines. Vous n'en avez pas besoin pour exécuter les poids ouverts, mais c'est la voie officielle pour personnaliser Inkling et elle porte la fenêtre de contexte à 256K.
---
Lectures associées
