AIREITER

Kokoro 82M TTS: CPU-Test lokal, Stimmen und Kosten

Zuletzt aktualisiert: 2026-09-28 01:24:04

Wer natürlich klingende Sprachaufnahmen erzeugen möchte, ohne jeden Satz an eine kostenpflichtige API zu schicken, sollte Kokoro 82M TTS auf die Testliste setzen. Die wichtige Einschränkung: „82M“ macht Kokoro nicht automatisch zum universellen ElevenLabs-Ersatz. Seine Stärken liegen bei Preset-Stimmen, sauberer Narration und lokalen Batch-Jobs. Voice-Cloning, ausgeprägte emotionale Steuerung und den Komfort eines verwalteten Dienstes liefern andere Lösungen besser.

Die schnelle Entscheidungshilfe

Kokoro-82M ist ein Open-Weight-Text-to-Speech-Modell mit 82 Millionen Parametern. Laut aktuellem Hugging-Face-Model-Card erschien v1.0 am 27. Januar 2025 und unterstützt acht Sprachen sowie 54 Stimmen. Die Gewichte stehen unter Apache 2.0: offizielle Model Card. Die offizielle Inferenzbibliothek ist hexgrad/kokoro.

Kokoro passt, wenn private oder Offline-Narration gefragt ist, Preset-Stimmen ausreichen und das Volumen hoch genug ist, dass API-Kosten ins Gewicht fallen. ElevenLabs ist die bessere Wahl für Voice-Cloning, ein verwaltetes Studio oder ausdrucksstarke kommerzielle Produktionen. Qwen3-TTS bietet sich an, wenn Mehrsprachigkeit und Klonen wichtiger sind als ein besonders kleiner Modell-Footprint.

Lokale Einrichtung: So klappt der erste Start

Die offiziellen Beispiele setzen auf Python, kokoro, soundfile, PyTorch und espeak-ng. Die Pipeline gibt Audio mit 24 kHz zurück. Unter Linux reicht für die grundlegende Installation:

pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng

Ein minimales Beispiel für Englisch sieht so aus:

from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."

for index, (_, _, audio) in enumerate(
    pipeline(text, voice="af_heart", speed=1)
):
    sf.write(f"kokoro-{index}.wav", audio, 24000)

Das Repository dokumentiert Sprachcodes für amerikanisches und britisches Englisch, Spanisch, Französisch, Hindi, Italienisch, Japanisch, brasilianisches Portugiesisch und Mandarin-Chinesisch. Für Japanisch und Mandarin werden die entsprechenden Misaki-Extras benötigt. Der Sprachcode muss zur gewählten Stimme passen.

Unter Windows gibt es keine Ein-Befehl-Installation: Die README des Projekts verweist auf das espeak-ng-MSI-Release. Auf Apple-Silicon-Macs kann PyTorch MPS mit PYTORCH_ENABLE_MPS_FALLBACK=1 ausprobiert werden. Solche Details sind beim ersten Start oft entscheidender als die reine Parameterzahl des Modells.

CPU, GPU und Echtzeittempo: Was tatsächlich belegt ist

CPU-Inferenz wird unterstützt. Weder die offizielle Model Card noch die offizielle Bibliothek nennen jedoch einen allgemein gültigen Echtzeitfaktor. Das Tempo hängt unter anderem von Laufzeitumgebung, Prozessor, Sprache, Textaufteilung und der Frage ab, ob beim ersten Durchlauf noch das Modell geladen wird.

Messungen aus der Community zeigen, warum pauschale Versprechen mit Vorsicht zu genießen sind. In einem ausführlichen Vergleich berichtete @analogalok von rund 0,7 Sekunden für die Erzeugung von 21 Sekunden Audio auf einer GPU; in diesem Setup wurden etwa 0,9 GB VRAM verwendet. Das belegt einen genügsamen GPU-Betrieb, ist aber keine Garantie für jedes Notebook.

„Ich kann es problemlos auf meiner CPU ausführen, und das erzeugte Audio klingt sehr angenehm.“ — @rasmus1610, X

Für die eigene Hardware sollten drei Werte getrennt gemessen werden:

  1. Die Zeit vom Prozessstart bis zum ersten Audiostück.
  2. Die Zeit nach dem Laden und Aufwärmen von Modell und Stimme.
  3. Die Audiodauer geteilt durch die Generierungszeit im warmen Zustand: der tatsächliche Echtzeitfaktor.

Für einen Batch-Narrator entscheidet vor allem der dritte Wert über den Durchsatz. Bei einem interaktiven Assistenten sind dagegen die Latenz bis zum ersten Token und das Streaming-Verhalten wichtiger. Ein GPU-Ergebnis darf nicht als CPU-Ergebnis verkauft werden, und ein 10-Sekunden-Sample ist noch kein Produktionsdurchsatz.

Stimmen, Sprachen und die entscheidenden Grenzen

Die Model Card von v1.0 nennt acht Sprachen und 54 Stimmen – deutlich mehr als v0.19 mit einer Sprache und 10 Stimmen. Die Bibliothek dokumentiert folgende Sprachcodes:

CodeSprache
aAmerikanisches Englisch
bBritisches Englisch
eSpanisch
fFranzösisch
hHindi
iItalienisch
jJapanisch
pBrasilianisches Portugiesisch
zMandarin-Chinesisch

Kokoro arbeitet mit Preset-Stimmen und ist kein Voice-Cloning-System auf Basis von Referenzaufnahmen. Für die Umwandlung von Graphemen in Phoneme nutzt es den Misaki-Stack sowie Fallback-Pfade über espeak-ng. Namen, Abkürzungen, Zahlen und gemischte Sprachen sollten vor einem langen Export getestet werden.

Die Apache-2.0-Lizenz der Gewichte ist für kommerzielle Einsätze attraktiv. „Das Modell steht unter Apache 2.0“ bedeutet allerdings nicht automatisch, dass damit auch jede Sprachprobe, jeder Datensatz und jede Drittanbieter-Abhängigkeit abgedeckt ist. Model Card, Sprachdateien und Lizenzbedingungen aller Abhängigkeiten gehören in die Release-Checkliste.

Kokoro vs. ElevenLabs vs. Qwen3-TTS

Ein Blindhörvergleich ist nur dann aussagekräftig, wenn alle drei Systeme denselben Text, dieselben Vorgaben für die Stimme, dieselbe Normalisierung, denselben Ausgabepegel und denselben Kreis an Testhörern verwenden. Dieser Artikel behauptet keinen Sieger aus einem kontrollierten Blindtest; die offiziellen Kokoro-Materialien veröffentlichen keinen solchen Vergleich. Belastbarer ist der Blick auf die Unterschiede im Workflow:

EntscheidungsfaktorKokoro-82MElevenLabsQwen3-TTS
BereitstellungLokal / offene GewichteGehostete API und StudioLokale Modellfamilie mit offenem Modell
Modelllizenz / QuelleGewichte unter Apache 2.0AnbieterbedingungenOffizielle Model Cards nennen Apache 2.0
Preset-StimmenJaGroße gehostete StimmenbibliothekCustomVoice und weitere Varianten
Voice-CloningNeinBei unterstützten Tarifen/Funktionen verfügbarDie Base-Variante unterstützt Klonen per Referenz
Sprachen8 für v1.0 aufgeführtModellabhängig; die offizielle API-Abrechnung variiert je nach Modell10 aufgeführte Sprachen
Am besten geeignet fürPrivate Batch-NarrationVerwaltete, ausdrucksstarke ProduktionMehrsprachige oder Cloning-Experimente
HauptkostenHardware oder gehostete InferenzAbrechnung nach Zeichen/CreditsHardware oder Hosting

Auf der offiziellen API-Preisseite von ElevenLabs stehen derzeit ungefähr 0,05 $ pro 1.000 Zeichen für Flash/Turbo und 0,10 $ pro 1.000 Zeichen für v2 Multilingual und v3: API-Preise. Die offizielle Model Card von Qwen3-TTS nennt Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch, Französisch, Russisch, Portugiesisch, Spanisch und Italienisch sowie Varianten mit Fokus auf Voice-Cloning: Qwen3-TTS Model Card.

Das praktische Fazit lautet also nicht „Kokoro klingt besser“. Kokoro eliminiert wiederkehrende API-Abhängigkeiten und kann den Text auf dem eigenen Rechner verarbeiten. ElevenLabs kauft dafür Komfort, Qwen3-TTS ein breiteres Paket für Mehrsprachigkeit und Cloning – allerdings mit einem größeren lokalen Modell-Footprint.

Batch-Narration: Diese Kosten lassen sich sauber kalkulieren

Bei lokalem Kokoro gibt es keine modellseitige Gebühr pro Zeichen. Die Grenzkosten bestehen aus Strom, Speicher sowie dem Rechner oder der Cloud-Instanz, auf der die Inferenz läuft. Wer die Hardware bereits besitzt, hat effektiv keine zusätzlichen Softwarekosten. Bei gemieteter GPU oder CPU gilt: Stundensatz des Anbieters multipliziert mit der tatsächlichen Generierungszeit.

Für den API-Vergleich nennt die Model Card von Kokoro für April 2025 gehostete Beispiele unter 1 $ pro einer Million Eingabezeichen, darunter 0,65 $ bei Replicate und 0,80 $ bei DeepInfra. Das sind zeitbezogene Referenzwerte und keine aktuellen Preisgarantien. Bei derselben Textmenge ergeben sich aus den offiziellen ElevenLabs-Tarifen:

WorkloadLokale Modellkosten von KokoroElevenLabs Flash/TurboElevenLabs v2 Multilingual/v3
100.000 Zeichen0 $ lokal*5 $10 $
1.000.000 Zeichen0 $ lokal*50 $100 $
10.000.000 Zeichen0 $ lokal*500 $1.000 $

\* Strom, Hardware, Hosting und Engineering-Zeit sind nicht enthalten. Die ElevenLabs-Werte basieren auf den offiziellen Tarifen von 0,05 $ bzw. 0,10 $ pro 1.000 Zeichen und berücksichtigen keine Tarifrabatte, Credits, Steuern oder Nachberechnungen. Die Tabelle ist ein Budgetmodell, keine Garantie für die endgültige Abrechnung.

Damit ist Kokoro besonders interessant für wiederholbare Narrationspipelines: Untertitel, Dokumentation, Audio für Barrierefreiheit und interne Schulungsvideos. Weniger attraktiv wird es, wenn der menschliche Aufwand für Aussprachekontrolle und das Zusammensetzen einzelner Segmente die API-Rechnung übersteigt.

FAQ

Läuft Kokoro auch ohne GPU?

Ja. CPU-Inferenz wird unterstützt, aber das offizielle Projekt verspricht keinen allgemein gültigen Echtzeitfaktor. Der warme Durchsatz sollte auf genau der CPU und in genau der Sprache gemessen werden, die später zum Einsatz kommen.

Kann Kokoro Stimmen klonen?

Nein. Kokoro arbeitet mit Preset-Stimmen. Wenn die Identität einer bestimmten Sprecherstimme entscheidend ist, sollte ein klonfähiges Modell wie eine passende Qwen3-TTS-Variante verwendet werden.

Ist Kokoro für die kommerzielle Nutzung kostenlos?

Die Model Card von Kokoro-82M führt die Gewichte unter Apache 2.0, einer freizügigen Lizenz. Vor dem kommerziellen Einsatz sollten trotzdem die konkreten Bedingungen für Stimme, Abhängigkeiten und Distribution geprüft werden.

Welche Sprachen unterstützt Kokoro?

Die Model Card von v1.0 nennt acht Sprachen. Die offizielle Bibliothek dokumentiert amerikanisches und britisches Englisch sowie Spanisch, Französisch, Hindi, Italienisch, Japanisch, brasilianisches Portugiesisch und Mandarin-Chinesisch. Je nach Sprache können zusätzliche Pakete erforderlich sein.

Ist Kokoro besser als ElevenLabs?

Nicht in jeder Hinsicht. Kokoro passt besser zu lokaler, privater Batch-Narration mit Preset-Stimmen. ElevenLabs ist die naheliegendere Wahl für verwaltete Infrastruktur, Voice-Cloning und ausdrucksstarke Produktions-Workflows.

Die praktische Wahl

Mit Kokoro zu starten lohnt sich, wenn der Abnahmetest lautet: „Kann dieser Rechner private, sauber klingende Narration mit dem benötigten Durchsatz und einer der verfügbaren Stimmen erzeugen?“ Getestet werden sollten Namen, Daten, Zahlen, lange Absätze und genau die Sprachen, die tatsächlich gebraucht werden.

Besteht das Modell diesen Test, ist die Rechnung einfach: Wiederkehrende Zeichenkosten werden durch Maschinenzeit ersetzt. Scheitert Kokoro dagegen an Aussprache, Sprecheridentität oder emotionaler Steuerung, ist der Wechsel zu ElevenLabs oder Qwen3-TTS kein Qualitätsverlust. Er bedeutet lediglich, für eine Fähigkeit zu bezahlen, die Kokoro bewusst nicht priorisiert.

Für die kommerzielle Variante dieser Entscheidung gibt es den ElevenLabs-Eleven-v3-API-Leitfaden.