Pour générer des voix off naturelles sans envoyer chaque phrase à une API payante, Kokoro 82M TTS fait partie des premiers modèles open source à essayer. Mais ses 82 millions de paramètres n’en font pas un remplaçant universel d’ElevenLabs : Kokoro donne surtout de bons résultats avec ses voix prédéfinies, les narrations propres et les traitements batch en local. Pour le clonage, le jeu émotionnel ou une infrastructure managée, il faudra regarder ailleurs.
En bref : quel outil choisir ?
Kokoro-82M est un modèle de synthèse vocale à poids ouverts, doté de 82 millions de paramètres. La fiche Hugging Face officielle indique que la version v1.0 est sortie le 27 janvier 2025 et prend en charge huit langues et 54 voix, avec des poids sous licence Apache 2.0 : fiche officielle du modèle. La bibliothèque d’inférence officielle est hexgrad/kokoro.
Choisissez Kokoro pour une narration privée ou hors ligne, si les voix prédéfinies vous conviennent et si le volume de production rend les frais d’API sensibles. Préférez ElevenLabs pour le clonage vocal, un studio prêt à l’emploi ou une production commerciale expressive. Qwen3-TTS sera plus pertinent si la couverture multilingue et le clonage passent avant la compacité du modèle.
Installation locale : la méthode qui fonctionne vraiment
Les exemples officiels utilisent Python, kokoro, soundfile, PyTorch et espeak-ng ; le pipeline renvoie un signal audio à 24 kHz. Sous Linux, l’installation de base se résume à :
pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng
Voici un exemple minimal en anglais :
from kokoro import KPipeline
import soundfile as sf
pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."
for index, (_, _, audio) in enumerate(
pipeline(text, voice="af_heart", speed=1)
):
sf.write(f"kokoro-{index}.wav", audio, 24000)
Le dépôt documente les codes de langue pour l’anglais américain et britannique, l’espagnol, le français, l’hindi, l’italien, le japonais, le portugais brésilien et le chinois mandarin. Le japonais et le mandarin nécessitent les extras Misaki correspondants. Le code de langue choisi doit correspondre à la voix utilisée.
Sous Windows, l’installation ne se fait pas en une seule commande : le README du projet renvoie vers la version MSI d’espeak-ng. Sur les Mac équipés d’une puce Apple Silicon, vous pouvez essayer PyTorch MPS avec PYTORCH_ENABLE_MPS_FALLBACK=1. Ces détails comptent davantage que le nombre de paramètres du modèle lorsqu’une première exécution échoue.
CPU, GPU et vitesse temps réel : ce que l’on peut réellement mesurer
L’inférence sur CPU est prise en charge, mais ni la fiche officielle du modèle ni la bibliothèque officielle ne donnent de facteur temps réel universel. La vitesse dépend de l’environnement d’exécution, du processeur, de la langue, du découpage du texte et du fait que le premier passage inclue ou non le chargement du modèle.
Les mesures de la communauté montrent pourquoi il faut se méfier des chiffres trop généraux. Dans une comparaison détaillée, @analogalok indique environ 0,7 seconde pour générer 21 secondes d’audio sur GPU, avec environ 0,9 Go de VRAM dans cette configuration. C’est un bon indicateur d’une exécution GPU peu gourmande en mémoire, pas une garantie pour tous les ordinateurs portables.
« Je peux l’exécuter confortablement sur mon CPU et le résultat est très agréable à écouter. » — @rasmus1610, X
Sur votre propre machine, mesurez séparément trois valeurs :
- Le temps entre le lancement du processus et le premier segment audio.
- Le temps nécessaire une fois le modèle et la voix chargés.
- La durée de l’audio divisée par le temps de génération à chaud : le véritable facteur temps réel.
Pour une chaîne de narration batch, c’est le troisième chiffre qui détermine le débit. Pour un assistant interactif, la latence avant le premier token et le comportement du streaming sont plus importants. Ne présentez pas un résultat GPU comme une mesure CPU et ne qualifiez pas de débit de production un échantillon de 10 secondes.
Voix, langues et limites à connaître
La fiche du modèle v1.0 annonce huit langues et 54 voix, contre une langue et 10 voix pour la version v0.19. La bibliothèque documente les codes de langue suivants :
| Code | Langue |
|---|---|
a | Anglais américain |
b | Anglais britannique |
e | Espagnol |
f | Français |
h | Hindi |
i | Italien |
j | Japonais |
p | Portugais brésilien |
z | Chinois mandarin |
Kokoro fonctionne avec des voix prédéfinies : ce n’est pas un système de clonage vocal à partir d’un échantillon de référence. Il s’appuie également sur la pile de conversion graphème-phonème Misaki et sur des chemins de repli utilisant espeak-ng. Les noms propres, abréviations, nombres et textes multilingues doivent être testés avant de lancer un export long.
La licence Apache 2.0 du modèle est intéressante pour un déploiement commercial, mais « le modèle est sous Apache 2.0 » ne règle pas automatiquement la question des échantillons de voix, des jeux de données ou des dépendances tierces. Ajoutez la fiche du modèle, les fichiers de voix et les licences des dépendances à votre checklist de mise en production.
Kokoro face à ElevenLabs et Qwen3-TTS
Une comparaison d’écoute à l’aveugle n’a de sens que si les trois systèmes utilisent le même texte, le même brief vocal, la même normalisation, le même niveau de sortie et le même panel d’évaluation. Cet article ne désigne donc pas de gagnant sur la base d’un test contrôlé ; les ressources officielles de Kokoro ne publient pas ce type de mesure. La comparaison la plus solide porte sur les compromis de workflow :
| Critère | Kokoro-82M | ElevenLabs | Qwen3-TTS |
|---|---|---|---|
| Déploiement | Poids ouverts, en local | API et studio hébergés | Famille de modèles ouverts, en local |
| Licence/source du modèle | Poids sous Apache 2.0 | Conditions du fournisseur | Les fiches officielles indiquent Apache 2.0 |
| Voix prédéfinies | Oui | Large bibliothèque de voix hébergée | Variantes CustomVoice et autres |
| Clonage vocal | Non | Disponible selon les offres et fonctionnalités prises en charge | La variante Base prend en charge le clonage à partir d’une référence |
| Langues | 8 annoncées pour v1.0 | Dépend du modèle ; la tarification officielle de l’API varie selon le modèle | 10 langues annoncées |
| Usage idéal | Narration batch privée | Production expressive et infrastructure managée | Expérimentations multilingues ou de clonage |
| Coût principal | Matériel ou inférence hébergée | Facturation au caractère ou au crédit | Matériel ou hébergement |
La page officielle de tarification de l’API ElevenLabs affiche actuellement environ 0,05 $ pour 1 000 caractères avec Flash/Turbo, et 0,10 $ pour 1 000 caractères avec v2 Multilingual et v3 : tarification de l’API. La fiche officielle de Qwen3-TTS indique la prise en charge du chinois, de l’anglais, du japonais, du coréen, de l’allemand, du français, du russe, du portugais, de l’espagnol et de l’italien, ainsi que de variantes orientées clonage : fiche du modèle Qwen3-TTS.
La conclusion pratique n’est pas que Kokoro « sonne mieux ». Kokoro supprime les frais récurrents d’API et permet de garder les textes sur votre machine, tandis qu’ElevenLabs mise sur la simplicité et que Qwen3-TTS offre une couverture multilingue et des fonctions de clonage plus larges, au prix d’une empreinte locale plus importante.
Coût d’une narration batch : les chiffres que l’on peut défendre
Avec Kokoro en local, il n’y a pas de facturation du modèle au caractère. Le coût marginal correspond à l’électricité, au stockage et à la machine — ou à l’instance cloud — utilisée pour l’inférence. Si vous possédez déjà la machine, le coût logiciel additionnel est pratiquement nul ; si vous louez un GPU ou un CPU, multipliez le tarif horaire du fournisseur par le temps réel de génération.
Pour comparer avec une API, la fiche du modèle Kokoro relevait en avril 2025 des exemples d’hébergement à moins de 1 $ par million de caractères en entrée, dont 0,65 $ sur Replicate et 0,80 $ sur DeepInfra. Ce sont des points de référence datés, pas des garanties de prix actuelles. À volume de texte équivalent, les tarifs officiels d’ElevenLabs donnent :
| Volume | Frais du modèle Kokoro en local | ElevenLabs Flash/Turbo | ElevenLabs v2 Multilingual/v3 |
|---|---|---|---|
| 100 000 caractères | 0 $ en local* | 5 $ | 10 $ |
| 1 000 000 caractères | 0 $ en local* | 50 $ | 100 $ |
| 10 000 000 caractères | 0 $ en local* | 500 $ | 1 000 $ |
\*Hors électricité, matériel, hébergement et temps d’ingénierie. Les chiffres d’ElevenLabs utilisent les tarifs officiels de 0,05 $/1 000 caractères et 0,10 $/1 000 caractères, sans tenir compte des remises liées aux offres, des crédits, des taxes ni des règles de dépassement. Ce tableau sert à établir un budget ; il ne garantit pas le montant final facturé.
Kokoro devient donc particulièrement intéressant pour les chaînes de narration répétitives : sous-titres, documentation, contenus audio d’accessibilité et modules de formation internes. Il l’est moins lorsque le temps humain consacré à vérifier la prononciation et à assembler les segments dépasse le montant économisé sur l’API.
FAQ
Kokoro peut-il fonctionner sans GPU ?
Oui. L’inférence CPU est prise en charge, mais le projet officiel ne promet aucun facteur temps réel universel. Mesurez le débit à chaud sur le CPU et dans la langue que vous comptez réellement utiliser.
Kokoro clone-t-il les voix ?
Non. Kokoro repose sur des voix prédéfinies. Si l’identité du locuteur est essentielle, utilisez un modèle capable de clonage, comme une variante appropriée de Qwen3-TTS.
Kokoro est-il gratuit pour un usage commercial ?
La fiche du modèle Kokoro-82M indique des poids sous licence Apache 2.0, une licence permissive. Vérifiez néanmoins les conditions exactes liées à la voix, aux dépendances et à la distribution avant de commercialiser un produit.
Quelles langues Kokoro prend-il en charge ?
La fiche du modèle v1.0 annonce huit langues ; la bibliothèque officielle documente l’anglais américain et britannique, ainsi que l’espagnol, le français, l’hindi, l’italien, le japonais, le portugais brésilien et le chinois mandarin. Des paquets spécifiques peuvent être nécessaires selon la langue.
Kokoro est-il meilleur qu’ElevenLabs ?
Pas sur tous les critères. Kokoro convient mieux à une narration batch locale, privée et basée sur des voix prédéfinies ; ElevenLabs sera plus adapté à une infrastructure managée, au clonage vocal et aux workflows de production expressive.
Le choix le plus pragmatique
Commencez par Kokoro si votre test d’acceptation tient en une question : « Cette machine peut-elle produire une narration propre, en privé, avec le débit requis et l’une des voix disponibles ? » Faites l’essai avec les noms, les dates, les nombres, les longs paragraphes et les langues dont vous avez réellement besoin.
Si le test est concluant, le calcul est simple : vous remplacez une facturation récurrente au caractère par du temps machine. Si le modèle échoue sur la prononciation, l’identité du locuteur ou la direction émotionnelle, passer à ElevenLabs ou Qwen3-TTS n’est pas un échec de qualité : vous payez simplement pour une capacité que Kokoro ne cherche volontairement pas à privilégier.
Pour le versant commercial de cette même décision, consultez le guide de l’API ElevenLabs Eleven v3.