AIREITER

Tarifs de l’API Qwen3.8 LiveTranslate et configuration WebSocket

Dernière mise à jour: 2026-09-18 18:53:54

Un traducteur vocal qui répond en environ 2,3 secondes semble taillé pour une salle de réunion. Qwen3.8-LiveTranslate est bien disponible, mais uniquement sous la forme d’une API hébergée par Alibaba Cloud/Model Studio ; le délai de 2,3 secondes est une revendication officielle, pas une mesure indépendante réalisée en production. Une nuance qui change forcément la manière de budgéter et de déployer le service.

La décision à prendre en 30 secondes

Qwen3.8-LiveTranslate mérite sa place dans un prototype encadré si vous avez besoin de traduction vocale en continu, de sous-titres et d’une sortie audio via une connexion temps réel. En revanche, ne prenez pas la latence annoncée pour une garantie dans les réunions bruyantes, les échanges simultanés ou toutes les paires de langues : les retours indépendants sur cette version précise restent encore rares.

Le modèle convient plutôt à un service backend capable de garder une clé API confidentielle et de composer avec une configuration Alibaba Cloud dépendante de la région. Il est moins adapté si vous recherchez des poids téléchargeables, une offre d’hébergement tierce bien établie ou des benchmarks de précision solides avant de fixer vos exigences de production.

Ce qui est réellement disponible

L’identifiant exact du modèle hébergé est qwen3.8-livetranslate-flash-realtime. La documentation officielle d’Alibaba Cloud et le changelog de Model Studio le présentent comme un service temps réel lancé le 17 septembre 2026. La fiche officielle mentionne 60 langues sources reconnues et 29 langues de sortie vocale.

QuestionRéponse actuelle
Est-il disponible ?Oui, sous la forme d’un modèle accessible via une API hébergée
Identifiant du modèleqwen3.8-livetranslate-flash-realtime
Transport principalAPI temps réel, notamment via WebSocket
EntréesAudio et contexte image
SortiesTexte et audio, selon la configuration de la session
Latence annoncée officiellementEnviron 2,3 secondes de bout en bout
Poids ouvertsAucune preuve officielle trouvée

On est donc face à une offre plus concrète qu’un simple teaser, mais pas à un modèle open source à télécharger. La documentation officielle décrit un accès à l’inférence via Model Studio, et non des checkpoints à exécuter en local.

Page officielle du modèle Qwen3.8 LiveTranslate

Calculer le coût avant d’écrire la moindre ligne de code

Pour le déploiement international/Singapour, la grille tarifaire officielle distingue quatre catégories facturées. Les prix indiqués correspondent à un million de tokens :

Unité facturéeTarif officiel
Entrée audio$7.50 / 1M tokens
Entrée image$0.55 / 1M tokens
Sortie texte$20 / 1M tokens
Sortie audio$30 / 1M tokens

Le guide de traduction temps réel de Qwen indique que l’audio entrant est comptabilisé à raison de 7 tokens par seconde, contre 12,5 tokens par seconde pour l’audio généré. Il devient donc possible d’estimer le coût de l’entrée pour un flux continu :

  • 60 secondes d’audio en entrée : 420 tokens, soit environ $0.00315 au tarif indiqué pour l’audio entrant.
  • 60 secondes d’audio généré en sortie : 750 tokens, soit environ $0.0225 au tarif indiqué pour l’audio sortant.

Ces montants ne constituent pas un « coût par minute » complet. Ils ne tiennent pas compte de la sortie texte, des images, du comportement de la connexion ni du fait que l’audio traduit puisse durer plus ou moins longtemps que la source. Une demande limitée au texte modifie également l’unité de facturation utilisée pour la sortie. Consultez la page officielle des tarifs des modèles correspondant à la région et au déploiement que vous utiliserez réellement.

Référence des tarifs de Qwen Model Studio

Le chemin WebSocket à retenir

L’intégration documentée repose sur une session temps réel côté serveur, et non sur une simple requête de traduction ponctuelle. La documentation de l’API temps réel officielle présente WebSocket comme l’option la plus directe pour les applications serveur et les prototypes.

Une implémentation minimale suit ce schéma :

  1. Créer une URL WebSocket temps réel adaptée à la région, en utilisant qwen3.8-livetranslate-flash-realtime comme modèle.
  2. Envoyer Authorization: Bearer <API_KEY> pendant la négociation ; la clé doit rester sur votre backend.
  3. Envoyer session.update avec la langue source, la langue cible et les modalités de sortie souhaitées.
  4. Diffuser l’audio encodé en base64 avec input_audio_buffer.append.
  5. Valider le buffer ou laisser la détection d’activité vocale configurée déclencher le traitement.
  6. Récupérer les événements de texte et d’audio traduits jusqu’à la fin du tour de parole.

Le point de terminaison dépend de l’espace de travail et de la région. Copier le nom d’hôte d’un autre déploiement peut donc suffire à faire échouer la connexion, même si la charge utile des événements est correcte. La référence des événements client LiveTranslate est le document à consulter pour la configuration de session, la détection d’activité vocale, les mots-clés et les validations manuelles.

Les cas où il est pertinent — et ceux où il ne l’est pas

UsageAdéquationPourquoi
Sous-titrage en direct pour un flux maîtriséBon candidat pour un prototypeL’audio en continu et la sortie texte correspondent à la conception de l’API
Traduction backend pour une application bidirectionnelleOui, avec des testsWebSocket maintient la session ouverte et peut renvoyer de l’audio
Petite réunion avec des tours de parole clairsPlausibleLa traduction temps réel tenant compte des locuteurs fait partie du positionnement documenté
Conférence bruyante avec interruptionsNon démontréAucun élément indépendant ici ne mesure la gestion des voix qui se chevauchent, des accents ou du bruit
Interprétation médicale ou juridique à forts enjeuxPas un choix par défautLes éléments disponibles ne permettent pas d’établir la fiabilité de la terminologie
Déploiement local ou hors ligneNonLa version officielle est un service hébergé, pas un modèle téléchargeable

Un signal intéressant côté écosystème vient de l’implémentation open source AlbusWei/LiveTranslate. Son README décrit des modes de traduction individuelle, de doublage de fichiers et de réunion, avec WebRTC comme transport prioritaire et WebSocket en solution de repli. Cela montre qu’il est possible de construire une surcouche pratique autour des modèles temps réel de Qwen ; cela ne démontre ni la précision de Qwen3.8 ni sa disponibilité en production.

Ce que les éléments disponibles permettent — ou non — d’affirmer

La documentation officielle fournit une fiche fonctionnelle et tarifaire assez précise, mais les tests indépendants restent le maillon faible. Les discussions de la communauté ne comptent que quelques publications consacrées à cette version exacte, et aucun fil Reddit substantiel dédié à Qwen3.8-LiveTranslate n’a été trouvé.

Un utilisateur réel a résumé l’évolution annoncée avec prudence :

« 2.3 秒还没有消失,但已经更接近人类能自然接话的节奏了。 » — @WukongNumber1, X

Cette remarque est intéressante comme réaction humaine à la promesse de latence, pas comme benchmark. Une autre discussion Reddit consacrée à l’utilisation antérieure de Qwen pour la traduction est également partagée : u/ReplacementTommy écrit : « Honnêtement, Qwen AI est le système de traduction le plus précis et le plus naturel que j’ai utilisé », tandis que u/Valhall22 affirme que Qwen ne figurait pas dans son top cinq lors de tests en anglais, allemand et français. Ces témoignages ne portent ni sur le modèle temps réel Qwen3.8 exact ni sur un protocole contrôlé ; ils ne doivent donc pas être transformés en classement.

La conclusion pratique est plus limitée : Qwen3.8-LiveTranslate est officiellement accessible, sa facturation est documentée et son architecture temps réel est exploitable. La précision dans des conditions vocales difficiles reste à valider par chaque acheteur.

FAQ sur l’API Qwen3.8 LiveTranslate

Qwen3.8 LiveTranslate est-il disponible ?

Oui. La documentation d’Alibaba Cloud présente qwen3.8-livetranslate-flash-realtime comme un modèle d’API hébergé dans Model Studio. Les éléments disponibles ne montrent pas de version open weight.

Qwen3.8 LiveTranslate utilise-t-il WebSocket ?

Oui. L’API temps réel officielle et les références des événements LiveTranslate documentent l’accès WebSocket, l’authentification, les mises à jour de session, les événements liés au buffer audio et la sortie diffusée en continu.

Combien coûte Qwen3.8 LiveTranslate par minute ?

Il n’existe pas de tarif universel à la minute, car l’audio entrant, le texte sortant, l’audio sortant et le contexte image utilisent des unités de facturation distinctes. Avec les valeurs documentées de 7 tokens d’entrée par seconde et de 12,5 tokens de sortie par seconde, une minute d’audio entrant coûte environ $0.00315 et une minute d’audio généré environ $0.0225 aux tarifs internationaux indiqués, avant de compter le texte et les autres usages.

Peut-il renvoyer du texte sans audio traduit ?

Oui. La session peut définir les modalités de sortie, notamment le texte seul ou le texte accompagné d’audio. Vérifiez les noms d’événements actuels dans la documentation officielle des événements client avant la mise en production.

Combien de langues prend-il en charge ?

Les informations officielles du modèle indiquent 60 langues reconnues et 29 langues de sortie vocale. Le nombre de langues disponibles en audio est donc inférieur au nombre de langues reconnues.

Peut-il traduire une vidéo en temps réel ?

Le modèle accepte de l’audio et du contexte image, et il est présenté comme adapté à la traduction audiovisuelle. Cela ne signifie pas que tous les workflows de doublage vidéo à partir de fichiers utilisent ce modèle temps réel ; Qwen documente des chemins distincts pour la traduction audio/vidéo non temps réel.

Puis-je télécharger le modèle et l’exécuter en local ?

Aucune version open weight officielle n’a été trouvée pour ce modèle temps réel précis. Il faut donc partir sur une inférence hébergée, sauf si Qwen publie séparément un checkpoint et sa licence.

La bonne approche : prototyper avec un interrupteur de secours

Qwen3.8-LiveTranslate mérite un prototype API contrôlé, pas un engagement aveugle en production. Avant le déploiement, testez trois points avec vos propres enregistrements audio : le délai mesuré avant la première sortie traduite, la qualité de chaque paire de langues avec les noms propres et les termes métier, ainsi que le comportement pendant les silences, les interruptions et les reconnexions.

Gardez le modèle derrière un paramètre de configuration afin de pouvoir changer de région, de transport ou de fournisseur sans réécrire l’application. C’est aujourd’hui le compromis le plus raisonnable : l’API et ses tarifs sont suffisamment concrets pour commencer à développer, tandis que les questions les plus importantes en production — précision dans une salle bruyante et fiabilité sur la durée — doivent encore figurer dans votre plan de tests plutôt que dans l’annonce de lancement.

Sources consultées