AIREITER
DOCS APITARIFS
MODÈLES
  • AIReiter
  • Blog
  • Ling 3.0 Flash : modèle 124B, 5,1B actifs, gratuit pour l’instant

Ling 3.0 Flash : modèle 124B, 5,1B actifs, gratuit pour l’instant

Dernière mise à jour: 2026-07-24 03:42:04

Les modèles de 124 milliards de paramètres sont généralement lents et coûteux à exploiter. Ling 3.0 Flash prend le contre-pied : il n’active qu’environ 5,1B de paramètres par token et, pour le moment, il est possible de l’utiliser gratuitement.

inclusionAI l’a lancé le 23 juillet 2026. Ce modèle Mixture-of-Experts (MoE) à raisonnement hybride vise les agents : développement, appels d’outils, recherche et tâches longues.

Ling 3.0 Flash, c’est quoi exactement ?

Ling 3.0 Flash est développé par inclusionAI, le groupe de recherche à l’origine des familles de modèles Ling et Ring d’Ant Group. Ant Group est la fintech qui se trouve derrière Alipay. Le suffixe « Flash » désigne l’offre rapide et économique, située sous les très grands modèles phares du groupe.

C’est un modèle Mixture-of-Experts : sur ses 124B de paramètres au total, seuls ~5,1B sont sollicités pour chaque token. À l’usage, son coût et sa vitesse se rapprochent donc davantage de ceux d’un petit modèle.

Il propose aussi un raisonnement hybride : il répond directement aux requêtes simples, puis bascule vers un mode de réflexion plus long pour les problèmes difficiles. inclusionAI le destine aux « agents à l’échelle de la production » : des charges de travail capables d’appeler des outils, de naviguer, d’écrire et d’exécuter du code, tout en conservant un état sur de nombreuses étapes.

124B de capacité, seulement 5,1B activés

La comparaison avec son prédécesseur, Ling 2.6 Flash, résume bien le positionnement. Le nombre total de paramètres augmente, de 104B à 124B, tandis que le nombre de paramètres actifs diminue, de 7,4B à 5,1B.

Graphique à barres comparant Ling 2.6 Flash et Ling 3.0 Flash : le total de paramètres passe de 104B à 124B, tandis que les paramètres actifs par token tombent de 7,4B à 5,1B

Davantage de paramètres totaux offrent plus d’espace pour stocker des connaissances. Moins de paramètres activés réduit le coût de génération de chaque token. En pratique, on se rapproche du coût d’inférence d’un modèle d’environ 5B, tout en profitant d’une capacité de 124B.

C’est particulièrement intéressant pour les agents. Lorsqu’une tâche consomme des milliers de tokens au fil de nombreux appels d’outils, le coût par token devient l’élément déterminant de la facture. Réduire le nombre de paramètres actifs pèse alors davantage qu’un total de paramètres plus impressionnant sur le papier.

Sous le capot, le modèle s’appuie sur une pile d’attention linéaire hybride. inclusionAI décrit un bloc répété de cinq couches KDA, basées sur l’attention linéaire, pour une couche d’attention complète MLA. L’attention linéaire limite le coût des longues entrées ; la couche d’attention complète périodique préserve la précision de rappel que perdent les modèles purement linéaires. C’est ce qui permet à Flash d’offrir un contexte natif de 256K, avec une marge vers 1M. Les routeurs l’affichent sous la forme 262K, soit le nombre exact de tokens : 262 144.

Un modèle pensé pour les agents

Flash est optimisé pour le travail agentique plutôt que pour la conversation ouverte. L’annonce d’inclusionAI met en avant une meilleure précision dans les appels d’outils, une plus grande stabilité sur les tâches de longue durée et une meilleure compatibilité avec les frameworks courants de « harness » pour agents. Les démonstrations de lancement vont dans ce sens : une ville 3D dans Blender, de la recherche multi-agent, des tâches Office via MCP et des applications de navigateur.

Pour le code, inclusionAI le positionne sur le raisonnement spatial et structurel, notamment les grilles de scène et les positions relatives, en plus de la génération de code classique.

Une réserve s’impose sur les benchmarks : le modèle n’a que quelques jours, et les chiffres disponibles reposent sur les déclarations d’inclusionAI ainsi que sur les premiers essais de la communauté, pas sur des évaluations indépendantes. inclusionAI affirme que Flash égale ou dépasse son modèle phare d’environ 1 trillion de paramètres sur de nombreuses tâches, avec une fraction des paramètres actifs. Son tableau de résultats indique également un score SWE-Bench Pro de 56,63 en mode réflexion. À considérer comme des chiffres éditeur tant qu’ils ne sont pas confirmés par des tiers.

Essayer Ling 3.0 Flash gratuitement dès maintenant

Le chemin le plus rapide passe par OpenRouter. Le modèle y est référencé sous le nom inclusionai/ling-3.0-flash, avec un tarif de lancement de 0 $ en entrée comme en sortie, et une gratuité jusqu’au 3 août 2026 (tarifs vérifiés le 24 juillet 2026). Il est également gratuit sur ZenMux. Les deux services proposent une API compatible OpenAI.

Voici un appel minimal :

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inclusionai/ling-3.0-flash",
    "messages": [{"role": "user", "content": "Write a Python function to parse a CSV."}]
  }'
Page du modèle Ling-3.0-flash sur OpenRouter, indiquant un MoE 124B avec 5,1B de paramètres actifs, 262K de contexte et une date de sortie au 23 juillet 2026

Tout client utilisant déjà chat/completions fonctionnera après avoir remplacé l’URL de base, la clé et le nom du modèle. Un routeur de modèles permet également de comparer Ling 3.0 Flash à votre modèle actuel sur les mêmes prompts, sans rien réécrire.

Deux points sont à anticiper. La période gratuite est promotionnelle : une tarification à l’usage est donc à prévoir après le début août. À titre de repère, Ling 2.6 Flash, son prédécesseur, est affiché autour de 0,01 $ en entrée et 0,03 $ en sortie par million de tokens. Par ailleurs, un seul fournisseur servait le modèle au lancement ; le débit et la disponibilité dépendent donc de ce seul backend.

Peut-on télécharger les poids ?

C’est là que les recherches « Ling 3.0 flash download » ou « Ling 3.0 flash github » se heurtent à une limite. Au lancement, les poids n’étaient pas publiés. Flash est pour l’instant accessible uniquement par API.

La situation diffère de celle du modèle précédent : Ling 2.6 Flash a été publié avec des poids ouverts sur Hugging Face, et peut donc être exécuté localement dès aujourd’hui. Ce n’est pas le cas de Flash 3.0.

Pour l’auto-hébergement ou la quantification sur votre propre matériel, surveillez la page Hugging Face d’inclusionAI : les poids 2.6 y sont disponibles, et une publication 3.0 y apparaîtrait si le groupe reproduit son approche précédente. D’ici là, les routeurs API ci-dessus sont le seul moyen d’y accéder.

Ling 3.0 Flash face à Ling 2.6 Flash

Ling 3.0 FlashLing 2.6 Flash
Sortie23 juil. 202621 avr. 2026
Paramètres totaux124B104B
Actifs par token~5,1B~7,4B
Fenêtre de contexte256K native (262K sur les routeurs)256K (262K sur les routeurs)
Poids ouvertsNon au lancementOui (Hugging Face)
Prix de lancementGratuit jusqu’au 3 août 2026~0,01 $ en entrée / 0,03 $ en sortie par 1M
OrientationAgents à raisonnement hybride, utilisation d’outils, codeModèle instruct rapide pour agents

En bref : 3.0 Flash échange une part du calcul actif contre davantage de capacité et un mode de raisonnement hybride, tout en adoptant une distribution centrée sur l’API. Si vous avez besoin de poids locaux et hors ligne, 2.6 Flash reste celui que vous pouvez télécharger.

Questions fréquentes

Ling 3.0 Flash est-il gratuit ?

Oui, pour le moment. Il est gratuit sur OpenRouter jusqu’au 3 août 2026, ainsi que sur ZenMux. Une tarification à l’usage est à prévoir à la fin de cette période.

Ling 3.0 Flash est-il open source ? Peut-on le télécharger ou le trouver sur GitHub ?

Pas au lancement. Aucun poids n’a été publié : le modèle est donc accessible uniquement par API, sans téléchargement ni dépôt. Utilisez OpenRouter (inclusionai/ling-3.0-flash) ou ZenMux. L’ancien Ling 2.6 Flash est ouvert sur Hugging Face ; d’éventuels poids 3.0 devraient donc vraisemblablement y apparaître aussi.

Ling 3.0 Flash est-il un modèle chinois ?

Oui. Il est développé par inclusionAI, le groupe de recherche en IA lié à Ant Group, la fintech chinoise derrière Alipay.

Quelle est la taille de Ling 3.0 Flash ?

Il compte 124B de paramètres au total et ~5,1B de paramètres actifs par token grâce à son architecture MoE. Son contexte natif atteint 256K et, selon inclusionAI, peut évoluer vers 1M.

Ling 3.0 Flash ou Ling 2.6 Flash : lequel choisir ?

Choisissez 3.0 Flash pour les agents à raisonnement hybride et un coût par token inférieur via API. Préférez 2.6 Flash si vous avez besoin de télécharger les poids et d’exécuter le modèle localement, car 3.0 n’est pas encore ouvert.

À lire aussi

  • Ce qui change dans Fugu-Ultra v1.1 et comment y accéder
  • La fuite sur Claude Opus 5 : faits confirmés et rumeurs

>_Répertoire des modèles AIReiter

Accès API rapide aux modèles liés à ce guide

Claude Opus 5

Chat

Un modèle Claude premium pour le raisonnement complexe, le codage et le travail professionnel à long contexte.

AnthropicCréer une API Key >

Claude Fable 5

Chat

Un modèle Claude premium pour le raisonnement approfondi et le travail long et complexe.

AnthropicCréer une API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCréer une API Key >

Claude Opus 4.8

Chat

Un modèle Claude hautement performant pour les tâches de raisonnement exigeantes et le travail professionnel.

AnthropicCréer une API Key >

Claude Sonnet 5

Chat

Un modèle Claude équilibré pour le raisonnement avancé, le codage et le travail quotidien.

AnthropicCréer une API Key >

Articles récents

OpenAI Agents API en bêta publique : tarifs, sandbox et limites

2026-09-11

API GPT-Live full-duplex : architecture des agents vocaux

2026-09-10

Tarifs de l’API GPT-Live-1 : disponibilité, coûts et alternatives

2026-09-10

Routage OpenRouter en région US : configuration et limites

2026-09-10
AIREITER

Des questions ? Contactez-nous à
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vidéo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Image IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Voir tout →

Entreprise

Politique de confidentialitéConditions d'utilisationPolitique de remboursement

© 2026 AIReiter. Tous droits réservés.