AIREITER
XiaomiText Chat

MiMo V2.6 Flash

Xiaomi MiMo V2.6 Flash combine un contexte de 1 048 576 tokens et des capacités multimodales avec une latence ultra-faible. MoE de 309B avec 15B de paramètres actifs à environ 1/3 du coût de Pro.

EntréeAIReiter $0.14 par million de tokensSortieAIReiter $0.28 par million de tokens
Exécuter avec l'API

ENTRÉE

SORTIE

Example
Generated in
42.7 seconds
Token d’entrée
134
Token de sortie
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Détails du modèle

Utilisez la même clé de modèle dans le Playground, les requêtes API et les workflows internes.

ID du modèle
mimo-v2.6-flash
Fournisseur
Xiaomi
Protocole
OpenAI Chat Completions
Fenêtre de contexte
1,048,576 tokens
Sortie maximale
131,072 tokens
Token d’entrée
14 crédits / 1 M de tokens
Token de sortie
28 crédits / 1 M de tokens
Lecture du cache
-
Écriture du cache
-

MoE à haut débit avec fenêtre contextuelle complète de 1M

MiMo-V2.6-Flash est le modèle MoE de Xiaomi optimisé pour la vitesse, offrant des temps de réponse instantanés et un débit exceptionnel tout en préservant une fenêtre contextuelle intégrale de 1 048 576 tokens.

Efficacité avec 15B de paramètres actifs

Doté de 309 milliards de paramètres au total avec 15 milliards d'actifs par token, Flash est conçu pour une concurrence massive et un délai avant premier token inférieur à la seconde.

Mémoire intégrale de 1 048 576 tokens

Aucun compromis sur la mémoire : injectez des sites de documentation entiers, des journaux de transactions à haut volume ou de vastes bases de code dans un pipeline d'inférence à grande vitesse.

Mêmes entrées que Pro

Texte, images, vidéo et audio en entrée. Texte en sortie.

Tarifs sur cette page

0,14 $ en entrée et 0,28 $ en sortie par million de tokens, soit environ un tiers de Pro. Les chiffres en haut de la page correspondent aux tarifs facturés.

Conçu pour les pipelines de production à forte concurrence

Conçu pour les scénarios où le débit, la latence et les coûts opérationnels sont les facteurs clés de succès.

Essaims de sous-agents et répartition de tâches

Le moteur idéal pour les agents d'exécution parallèle, les boucles de recherche itératives, la réconciliation automatisée des données et les pipelines autonomes de tri des tâches.

Revue de code et linting ultra-rapides

Analysez rapidement les pull requests, vérifiez la conformité de la syntaxe et du style, suggérez des optimisations directes et générez des tests unitaires à très grande vitesse.

Analyse de documents à grande échelle et extraction JSON

Analysez des milliers de factures non structurées, de PDF, de rapports et de captures multimodales en schémas JSON propres et validés avec une latence minimale.

UX conversationnelle en temps réel à faible latence

Offrez des expériences conversationnelles réactives et fluides pour le service client, le tutorat éducatif et les copilotes en direct, sans aucun décalage.

Conception de flotte hybride : le schéma de production 80/20

Comment les équipes d'ingénierie de production combinent Flash et Pro pour maximiser l'intelligence par dollar d'infrastructure investi.
01

Allocation de 80 % de la charge de travail à Flash

Acheminez 80 % du volume conversationnel quotidien, du tri des données, de la synthèse et de la rédaction initiale vers Flash pour un débit maximal et des coûts réduits au minimum.

02

Escalade instantanée vers Pro

Lorsqu'un cas particulier nécessite un raisonnement architectural multi-dépôts ou une vérification mathématique complexe, basculez ce prompt en toute transparence vers MiMo V2.6 Pro.

03

Jusqu'à 131 072 tokens en sortie

Contrairement aux modèles légers habituels qui limitent la taille de génération, Flash peut produire jusqu'à 128K tokens lorsque de grands volumes de données synthétiques ou de rapports sont requis.

04

Tarifs forfaitaires sans paliers pénalisants

Une tarification des tokens constante sur l'ensemble de la fenêtre de 1M, sans paliers de pénalité ni hausses imprévues à mesure que la taille du prompt augmente.

Déploiement immédiat en deux étapes

Déployez MiMo V2.6 Flash avec des bibliothèques compatibles OpenAI en quelques secondes.

01

Configurer le client standard OpenAI

Définissez l'URL de base sur https://aireiter.com/api/v1 et fournissez votre clé API AIReiter. Compatible avec tous les principaux frameworks d'orchestration.

02

Exécuter une requête de complétion à haute vitesse

POST https://aireiter.com/api/v1/chat/completions Authorization: Bearer $AIREITER_API_KEY Content-Type: application/json { "model": "mimo-v2.6-flash", "messages": [ {"role": "user", "content": "Extract all line items and tax totals from this invoice into structured JSON."} ], "temperature": 0.1 }

03

Mettre à l'échelle sur plusieurs workers

Des limites de simultanéité élevées et une émission rapide de tokens font de Flash le choix idéal pour les workers en arrière-plan multi-tenants et les traitements par lots.

FAQ technique de MiMo V2.6 Flash

Détails de l'architecture, métriques de performance et conseils de déploiement.

/ 01

La fenêtre de contexte de Flash est-elle plus petite que celle de Pro ?

Non. MiMo V2.6 Flash et Pro partagent exactement la même fenêtre de contexte de 1 048 576 tokens et une limite maximale de génération de 128K.

/ 02

Qu'est-ce qui rend Flash nettement plus rapide et plus économique ?

Flash active environ 15 milliards de paramètres par token (sur un total MoE de 309 milliards), contre 42 milliards pour Pro, ce qui réduit la latence de calcul de plus de 60 %.

/ 03

Flash prend-il en charge les entrées multimodales telles que les images et l'audio ?

Oui. Flash traite nativement le texte, les fichiers images, les séquences de trames vidéo et les entrées audio avec une parité totale des fonctionnalités.

/ 04

Quel identifiant de modèle dois-je envoyer dans les appels API ?

Spécifiez mimo-v2.6-flash dans le champ model de votre requête Chat Completions.

/ 05

Quand devrais-je faire passer une requête vers MiMo V2.6 Pro ?

Passez à la version supérieure lorsque les tâches nécessitent un refactoring architectural multifichier approfondi, des démonstrations mathématiques complexes ou une vérification transversale exhaustive où un raisonnement profond est indispensable.