Les modèles de 124 milliards de paramètres sont généralement lents et coûteux à exploiter. Ling 3.0 Flash prend le contre-pied : il n’active qu’environ 5,1B de paramètres par token et, pour le moment, il est possible de l’utiliser gratuitement.
inclusionAI l’a lancé le 23 juillet 2026. Ce modèle Mixture-of-Experts (MoE) à raisonnement hybride vise les agents : développement, appels d’outils, recherche et tâches longues.
Ling 3.0 Flash, c’est quoi exactement ?
Ling 3.0 Flash est développé par inclusionAI, le groupe de recherche à l’origine des familles de modèles Ling et Ring d’Ant Group. Ant Group est la fintech qui se trouve derrière Alipay. Le suffixe « Flash » désigne l’offre rapide et économique, située sous les très grands modèles phares du groupe.
C’est un modèle Mixture-of-Experts : sur ses 124B de paramètres au total, seuls ~5,1B sont sollicités pour chaque token. À l’usage, son coût et sa vitesse se rapprochent donc davantage de ceux d’un petit modèle.
Il propose aussi un raisonnement hybride : il répond directement aux requêtes simples, puis bascule vers un mode de réflexion plus long pour les problèmes difficiles. inclusionAI le destine aux « agents à l’échelle de la production » : des charges de travail capables d’appeler des outils, de naviguer, d’écrire et d’exécuter du code, tout en conservant un état sur de nombreuses étapes.
124B de capacité, seulement 5,1B activés
La comparaison avec son prédécesseur, Ling 2.6 Flash, résume bien le positionnement. Le nombre total de paramètres augmente, de 104B à 124B, tandis que le nombre de paramètres actifs diminue, de 7,4B à 5,1B.
Davantage de paramètres totaux offrent plus d’espace pour stocker des connaissances. Moins de paramètres activés réduit le coût de génération de chaque token. En pratique, on se rapproche du coût d’inférence d’un modèle d’environ 5B, tout en profitant d’une capacité de 124B.
C’est particulièrement intéressant pour les agents. Lorsqu’une tâche consomme des milliers de tokens au fil de nombreux appels d’outils, le coût par token devient l’élément déterminant de la facture. Réduire le nombre de paramètres actifs pèse alors davantage qu’un total de paramètres plus impressionnant sur le papier.
Sous le capot, le modèle s’appuie sur une pile d’attention linéaire hybride. inclusionAI décrit un bloc répété de cinq couches KDA, basées sur l’attention linéaire, pour une couche d’attention complète MLA. L’attention linéaire limite le coût des longues entrées ; la couche d’attention complète périodique préserve la précision de rappel que perdent les modèles purement linéaires. C’est ce qui permet à Flash d’offrir un contexte natif de 256K, avec une marge vers 1M. Les routeurs l’affichent sous la forme 262K, soit le nombre exact de tokens : 262 144.
Un modèle pensé pour les agents
Flash est optimisé pour le travail agentique plutôt que pour la conversation ouverte. L’annonce d’inclusionAI met en avant une meilleure précision dans les appels d’outils, une plus grande stabilité sur les tâches de longue durée et une meilleure compatibilité avec les frameworks courants de « harness » pour agents. Les démonstrations de lancement vont dans ce sens : une ville 3D dans Blender, de la recherche multi-agent, des tâches Office via MCP et des applications de navigateur.
Pour le code, inclusionAI le positionne sur le raisonnement spatial et structurel, notamment les grilles de scène et les positions relatives, en plus de la génération de code classique.
Une réserve s’impose sur les benchmarks : le modèle n’a que quelques jours, et les chiffres disponibles reposent sur les déclarations d’inclusionAI ainsi que sur les premiers essais de la communauté, pas sur des évaluations indépendantes. inclusionAI affirme que Flash égale ou dépasse son modèle phare d’environ 1 trillion de paramètres sur de nombreuses tâches, avec une fraction des paramètres actifs. Son tableau de résultats indique également un score SWE-Bench Pro de 56,63 en mode réflexion. À considérer comme des chiffres éditeur tant qu’ils ne sont pas confirmés par des tiers.
Essayer Ling 3.0 Flash gratuitement dès maintenant
Le chemin le plus rapide passe par OpenRouter. Le modèle y est référencé sous le nom inclusionai/ling-3.0-flash, avec un tarif de lancement de 0 $ en entrée comme en sortie, et une gratuité jusqu’au 3 août 2026 (tarifs vérifiés le 24 juillet 2026). Il est également gratuit sur ZenMux. Les deux services proposent une API compatible OpenAI.
Voici un appel minimal :
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
}'
Tout client utilisant déjà chat/completions fonctionnera après avoir remplacé l’URL de base, la clé et le nom du modèle. Un routeur de modèles permet également de comparer Ling 3.0 Flash à votre modèle actuel sur les mêmes prompts, sans rien réécrire.
Deux points sont à anticiper. La période gratuite est promotionnelle : une tarification à l’usage est donc à prévoir après le début août. À titre de repère, Ling 2.6 Flash, son prédécesseur, est affiché autour de 0,01 $ en entrée et 0,03 $ en sortie par million de tokens. Par ailleurs, un seul fournisseur servait le modèle au lancement ; le débit et la disponibilité dépendent donc de ce seul backend.
Peut-on télécharger les poids ?
C’est là que les recherches « Ling 3.0 flash download » ou « Ling 3.0 flash github » se heurtent à une limite. Au lancement, les poids n’étaient pas publiés. Flash est pour l’instant accessible uniquement par API.
La situation diffère de celle du modèle précédent : Ling 2.6 Flash a été publié avec des poids ouverts sur Hugging Face, et peut donc être exécuté localement dès aujourd’hui. Ce n’est pas le cas de Flash 3.0.
Pour l’auto-hébergement ou la quantification sur votre propre matériel, surveillez la page Hugging Face d’inclusionAI : les poids 2.6 y sont disponibles, et une publication 3.0 y apparaîtrait si le groupe reproduit son approche précédente. D’ici là, les routeurs API ci-dessus sont le seul moyen d’y accéder.
Ling 3.0 Flash face à Ling 2.6 Flash
| Ling 3.0 Flash | Ling 2.6 Flash | |
|---|---|---|
| Sortie | 23 juil. 2026 | 21 avr. 2026 |
| Paramètres totaux | 124B | 104B |
| Actifs par token | ~5,1B | ~7,4B |
| Fenêtre de contexte | 256K native (262K sur les routeurs) | 256K (262K sur les routeurs) |
| Poids ouverts | Non au lancement | Oui (Hugging Face) |
| Prix de lancement | Gratuit jusqu’au 3 août 2026 | ~0,01 $ en entrée / 0,03 $ en sortie par 1M |
| Orientation | Agents à raisonnement hybride, utilisation d’outils, code | Modèle instruct rapide pour agents |
En bref : 3.0 Flash échange une part du calcul actif contre davantage de capacité et un mode de raisonnement hybride, tout en adoptant une distribution centrée sur l’API. Si vous avez besoin de poids locaux et hors ligne, 2.6 Flash reste celui que vous pouvez télécharger.
Questions fréquentes
Ling 3.0 Flash est-il gratuit ?
Oui, pour le moment. Il est gratuit sur OpenRouter jusqu’au 3 août 2026, ainsi que sur ZenMux. Une tarification à l’usage est à prévoir à la fin de cette période.
Ling 3.0 Flash est-il open source ? Peut-on le télécharger ou le trouver sur GitHub ?
Pas au lancement. Aucun poids n’a été publié : le modèle est donc accessible uniquement par API, sans téléchargement ni dépôt. Utilisez OpenRouter (inclusionai/ling-3.0-flash) ou ZenMux. L’ancien Ling 2.6 Flash est ouvert sur Hugging Face ; d’éventuels poids 3.0 devraient donc vraisemblablement y apparaître aussi.
Ling 3.0 Flash est-il un modèle chinois ?
Oui. Il est développé par inclusionAI, le groupe de recherche en IA lié à Ant Group, la fintech chinoise derrière Alipay.
Quelle est la taille de Ling 3.0 Flash ?
Il compte 124B de paramètres au total et ~5,1B de paramètres actifs par token grâce à son architecture MoE. Son contexte natif atteint 256K et, selon inclusionAI, peut évoluer vers 1M.
Ling 3.0 Flash ou Ling 2.6 Flash : lequel choisir ?
Choisissez 3.0 Flash pour les agents à raisonnement hybride et un coût par token inférieur via API. Préférez 2.6 Flash si vous avez besoin de télécharger les poids et d’exécuter le modèle localement, car 3.0 n’est pas encore ouvert.
