AIREITER
XiaomiText Chat

MiMo V2.6 Flash

Xiaomi MiMo V2.6 Flash kombiniert einen Kontext von 1.048.576 Tokens und multimodale Fähigkeiten mit extrem niedriger Latenz. 309B MoE mit 15B aktiven Parametern zu etwa 1/3 der Kosten von Pro.

EingabeAIReiter $0.14 pro 1 Mio. TokensAusgabeAIReiter $0.28 pro 1 Mio. Tokens
Mit API ausführen

EINGABE

AUSGABE

Example
Generated in
42.7 seconds
Eingabe-Token
134
Ausgabe-Token
2354
Tokens per second
55.13 tokens / second
Time to first token
-

Modelldetails

Verwenden Sie denselben Modellschlüssel im Playground, in API-Anfragen und in internen Workflows.

Modell-ID
mimo-v2.6-flash
Anbieter
Xiaomi
Protokoll
OpenAI Chat Completions
Kontextfenster
1,048,576 Token
Maximale Ausgabe
131,072 Token
Eingabe-Token
14 Credits / 1 Mio. Token
Ausgabe-Token
28 Credits / 1 Mio. Token
Cache-Lesen
-
Cache-Schreiben
-

Hochdurchsatz-MoE mit vollem 1M-Kontextfenster

MiMo-V2.6-Flash ist Xiaomis geschwindigkeitsoptimiertes MoE-Modell, das blitzschnelle Antwortzeiten und außergewöhnlichen Durchsatz liefert, während es ein volles Kontextfenster von 1.048.576 Tokens beibehält.

Effizienz durch 15B aktive Parameter

Mit 309 Milliarden Parametern insgesamt und 15 Milliarden aktiven Parametern pro Token ist Flash für massive Parallelität und eine Time-to-First-Token im Subsekundenbereich ausgelegt.

Vollständiger 1.048.576-Token-Speicher

Keine Kompromisse beim Speicher: Speisen Sie ganze Dokumentationsseiten, umfangreiche Transaktionsprotokolle oder riesige Codebases in eine High-Speed-Inferenz-Pipeline ein.

Gleiche Eingaben wie Pro

Text, Bilder, Video und Audio rein. Text raus.

Preise auf dieser Seite

Input 0,14 $ und Output 0,28 $ pro Million Tokens, etwa ein Drittel von Pro. Die Zahlen oben auf der Seite sind die abgerechneten Tarife.

Entwickelt für hochgradig parallele Produktions-Pipelines

Entwickelt für Szenarien, in denen Durchsatz, Latenz und Betriebskosten über den Erfolg entscheiden.

Sub-Agent-Schwärme & Task-Fanouts

Die ideale Engine für parallele Worker-Agenten, iterative Suchschleifen, automatisierten Datenabgleich und autonome Task-Triage-Pipelines.

Wire-Speed Code-Review & Linting

Scannen Sie Pull Requests blitzschnell, überprüfen Sie Syntax- und Stilkonformität, schlagen Sie Inline-Optimierungen vor und generieren Sie Unit-Tests mit maximaler Geschwindigkeit.

Skaliertes Dokumenten-Parsing & JSON-Extraktion

Parsen Sie Tausende unstrukturierte Rechnungen, PDFs, Berichte und multimodale Erfassungen mit minimaler Latenz in saubere, validierte JSON-Schemas.

Echtzeit-Konversations-UX mit geringer Latenz

Bieten Sie verzögerungsfreie, reaktionsschnelle Dialogerlebnisse für Kundenservice, Bildungstutoring und Live-Copiloten ohne Lags.

Hybrides Flottendesign: Die 80/20-Produktions-Blaupause

Wie Production-Engineering-Teams Flash und Pro kombinieren, um maximale Intelligenz pro Infrastruktur-Dollar zu erzielen.
01

80 % Workload-Zuweisung an Flash

Leiten Sie 80 % des täglichen Konversationsvolumens, der Datensortierung, der Zusammenfassungen und ersten Entwürfe an Flash weiter – für maximalen Durchsatz und minimale Kosten.

02

Sofortige Eskalation zu Pro

Wenn ein Edge Case Repository-übergreifendes Architektur-Reasoning oder komplexe mathematische Verifikation erfordert, leiten Sie den Prompt nahtlos an MiMo V2.6 Pro weiter.

03

Bis zu 131.072 Ausgabe-Tokens

Anders als typische leichtgewichtige Modelle, die die Generierungsgröße beschränken, kann Flash bis zu 128K Tokens ausgeben, wenn große synthetische Datenmengen oder Berichte erforderlich sind.

04

Einheitspreise ohne Preissprung-Multiplikatoren

Konsistente Token-Preise über die gesamte 1M-Kontextspanne hinweg, ohne Aufpreisstufen oder unerwartete Preisanstiege bei wachsender Prompt-Größe.

Drop-in-Deployment in zwei Schritten

Stellen Sie MiMo V2.6 Flash mit standardmäßigen OpenAI-kompatiblen Bibliotheken in Sekundenschnelle bereit.

01

Standard-OpenAI-Client konfigurieren

Setzen Sie die Basis-URL auf https://aireiter.com/api/v1 und geben Sie Ihren AIReiter-API-Schlüssel an. Kompatibel mit allen gängigen Orchestrierungs-Frameworks.

02

High-Speed-Completion-Anfrage ausführen

POST https://aireiter.com/api/v1/chat/completions Authorization: Bearer $AIREITER_API_KEY Content-Type: application/json { "model": "mimo-v2.6-flash", "messages": [ {"role": "user", "content": "Extract all line items and tax totals from this invoice into structured JSON."} ], "temperature": 0.1 }

03

Über Worker hinweg skalieren

Hohe Concurrency-Limits und eine schnelle Token-Generierung machen Flash zur optimalen Wahl für mandantenfähige Hintergrund-Worker und Batch-Jobs.

MiMo V2.6 Flash – Technische FAQ

Architekturdetails, Performance-Metriken und Bereitstellungstipps.

/ 01

Ist das Kontextfenster von Flash kleiner als das von Pro?

Nein. Sowohl MiMo V2.6 Flash als auch Pro teilen sich exakt dasselbe Kontextfenster von 1.048.576 Token und ein maximales Generierungslimit von 128K.

/ 02

Was macht Flash deutlich schneller und günstiger?

Flash aktiviert ca. 15 Milliarden Parameter pro Token (von insgesamt 309 Mrd. im MoE), verglichen mit 42 Milliarden bei Pro, was die Rechenlatenz um mehr als 60 % reduziert.

/ 03

Unterstützt Flash multimodale Eingaben wie Bilder und Audio?

Ja. Flash verarbeitet nativ Text-, Bilddateien, Videobildsequenzen und Audio-Eingaben mit voller Funktionsparität.

/ 04

Welche Modellkennung sollte ich bei API-Aufrufen übergeben?

Geben Sie mimo-v2.6-flash im model-Feld Ihrer Chat-Completions-Anfrage an.

/ 05

Wann sollte ich eine Anfrage auf MiMo V2.6 Pro upgraden?

Führen Sie ein Upgrade durch, wenn Aufgaben tiefgreifendes Datei-übergreifendes Architektur-Refactoring, komplexe mathematische Beweise oder umfassende domänenübergreifende Verifizierungen erfordern, bei denen Deep Reasoning unerlässlich ist.