En julio de 2026, Qwen-Audio-3.0-TTS-Plus de Alibaba alcanzó el primer puesto del arena de Text-to-Speech de Artificial Analysis, con un Quality Elo de 1.237. Superó a Gemini 3.1 Flash TTS de Google, MiniMax Speech 2.8 HD y Eleven v3 de ElevenLabs. Su precio publicado es de 27,6 $ por millón de caracteres: aproximadamente un tercio de lo que cobran ElevenLabs y MiniMax por las versiones a las que adelanta. No es el modelo más barato de la tabla, pero ningún otro combina la calidad nº 1 con ese precio. (Las cifras corresponden al 20 de julio de 2026; los proveedores cambian con frecuencia de posición y tarifas, así que conviene verificar ambos datos antes de tomar decisiones.)
Veamos qué es este modelo, por qué ha logrado ese puesto, cuánto cuesta y en qué casos merece la pena —o no— elegirlo.
No es lo mismo que Qwen3-TTS
Si buscas "Qwen audio 3.0 TTS", la mayoría de resultados te llevarán a Qwen3-TTS, la familia de voz con pesos abiertos que Alibaba lanzó antes y publicó en GitHub y en una demo de Hugging Face. Es el modelo que la gente ejecuta en local, integra con ComfyUI y comenta en Reddit por sus capacidades de clonación de voz. No es el mismo producto que analizamos aquí.
Qwen-Audio-3.0-TTS es la generación más reciente y alojada, disponible mediante Alibaba Cloud Model Studio (Bailian) en lugar de como pesos descargables. Se ofrece en dos variantes:
- Plus — la versión centrada en calidad, y la que ocupa el nº 1, pensada para audiolibros, narración y doblaje cuando la naturalidad importa más que unos milisegundos.
- Flash — la versión orientada a latencia, con una latencia hasta el primer paquete de unos 300 ms, diseñada para interacción en tiempo real, como agentes de voz y asistentes en directo.
La diferencia generacional salta a la vista en la misma clasificación: el anterior Qwen3 TTS Flash registra un Elo de 929 aproximadamente, en torno al puesto 76, mientras que el nuevo nivel Plus lidera con 1.237. Comparten linaje de marca, pero pertenecen a categorías distintas.
También responden a necesidades diferentes. Si estás dudando entre ambos, esta es la comparación clave:
| Qwen3-TTS (pesos abiertos) | Qwen-Audio-3.0-TTS (alojado) | |
|---|---|---|
| Cómo se obtiene | Descarga de pesos (GitHub / Hugging Face) | API mediante Alibaba Cloud Model Studio |
| Autoalojamiento / ejecución local | Sí | No — solo alojado |
| ComfyUI y nodos de la comunidad | Sí | No |
| Versiones | Una única familia abierta | Plus (calidad) / Flash (~300 ms) |
| Cobertura de idiomas | ~10 idiomas | 16 idiomas + 20 dialectos chinos |
| Quality Elo en el arena | ~929 (Qwen3 TTS Flash) | 1.237 (Plus, nº 1) |
| Ideal para | Control local, residencia de datos y experimentación | Máxima calidad, dialectos y producción a escala |
Elige la línea de pesos abiertos si priorizas el control sobre el alojamiento o un coste marginal cero. Las versiones alojadas 3.0 tienen más sentido si pesan más la calidad, la amplitud dialectal o evitar gestionar tus propias GPU.
El benchmark detrás del primer puesto
El arena de Artificial Analysis es una clasificación independiente basada en preferencias humanas a ciegas: los oyentes comparan fragmentos sin saber qué modelo los ha generado, y la puntuación Elo refleja la frecuencia con que gana cada uno.
Así estaba la parte alta de la clasificación el 20 de julio de 2026:
| Puesto | Modelo | Quality Elo | Precio de API / 1 M de caracteres |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1.237 | 27,6 $ |
| 2 | Simba 3.2 (SpeechifyAI) | 1.232 | 10,0 $ |
| 3 | Gemini 3.1 Flash TTS (Google) | 1.211 | 18,3 $ |
| 4 | Sonic 3.5 (Cartesia) | 1.211 | 49,0 $ |
| 8 | MiniMax Speech 2.8 HD | 1.180 | 100,0 $ |
| 11 | ElevenLabs Eleven v3 | 1.173 | 100,0 $ |
Las métricas comunicadas por Alibaba apuntan en la misma dirección que la clasificación independiente. En el benchmark multilingüe CV3-Eval, el proveedor informa de una tasa media de error de palabra/caracteres de 3,96 para Plus y de 3,87 para Flash; es decir, el audio sintetizado se transcribe de vuelta casi con la misma precisión que el texto original. La similitud de hablante, que mide el parecido entre una voz clonada y su referencia, alcanza 82,75 en Plus entre los 16 idiomas evaluados. Estas dos cifras proceden de Alibaba; el Elo anterior, no. Cualquier benchmark aislado debe tomarse como punto de partida y contrastarse con tu propio audio.
Sus puntos fuertes en producción
El resultado en el ranking se apoya en cuatro capacidades relevantes para uso real, documentadas en la página técnica oficial de Qwen-Audio-3.0-TTS.
Control mediante instrucciones naturales. Puedes guiar la voz con lenguaje cotidiano —"lee esto como un locutor de radio nervioso en plena madrugada, más despacio hacia el final"— y definir el personaje, la emoción, el estilo de habla, la velocidad, el timbre y el acento. Para los ajustes generales no hay que aprender un lenguaje de marcado específico.
Etiquetas integradas de control fino. Cuando se necesita precisión, el modelo interpreta 86 etiquetas insertadas directamente en el texto, incluidos eventos no verbales como risas, respiraciones, tos y suspiros. Es la diferencia entre una lectura plana y una interpretación; también lo que lo hace útil para diálogos de videojuegos, narración y doblaje cinematográfico.
Amplia cobertura lingüística y dialectal. Admite 16 idiomas, siete de ellos incorporados recientemente, entre los que figuran árabe, indonesio, portugués, tailandés, vietnamita, malayo y tagalo. Añade además 20 regiones dialectales chinas, desde cantonés y shanghainés hasta sichuanés y nororiental. Para equipos que publican en el Sudeste Asiático o en mercados de habla china, esa cobertura dialectal es difícil de igualar.
Solidez y calidad de salida. Clona voces incluso a partir de audios de referencia con ruido, reverberación o poca claridad, sin requerir un paso independiente de reducción de ruido. Puede sintetizar hasta tres minutos en una sola pasada para narraciones largas y genera audio a 48 kHz; el despliegue de 48 kHz en la consola está previsto para el 24 de julio. La generación en una única pasada durante tres minutos importa porque al unir clips más cortos es habitual que se desajusten la prosodia y el timbre.
Precio: calidad líder sin tarifa prémium
Los servicios de texto a voz se facturan por caracteres de texto de entrada, de modo que el coste crece de forma directa con el volumen narrado.
Con 27,6 $ por millón de caracteres, Qwen-Audio-3.0-TTS-Plus cuesta una fracción de lo que cobran dos nombres prémium consolidados a los que supera: ElevenLabs Eleven v3 y MiniMax Speech 2.8 HD figuran ambos a 100 $ por millón de caracteres, unas 3,6 veces más. En términos prácticos, un audiolibro de 100.000 caracteres, aproximadamente una novela corta, costaría unos 2,76 $ con Plus, frente a unos 10 $ con esos dos servicios.
Plus no es, eso sí, la opción más económica en términos absolutos. Dos modelos con una calidad algo inferior tienen tarifas menores: Gemini 3.1 Flash TTS cuesta 18,3 $ por millón de caracteres y ocupa el puesto 3, mientras que Simba 3.2 cuesta 10 $ y está en el puesto 2, casi empatado en Elo. La lectura correcta es más concreta: Qwen ofrece la calidad mejor clasificada a un precio intermedio, no el precio más bajo de la tabla. Si unos pocos puntos de Elo no son determinantes para tu caso, puedes pagar menos. (El arena público muestra el precio de Plus; todavía no publica la tarifa por carácter de Flash, así que consulta la consola para ver el importe vigente.)
Cómo usar Qwen-Audio-3.0-TTS
La vía directa es Alibaba Cloud Model Studio (Bailian). Los formatos de solicitud y los SDK están en la documentación de Model Studio: crea una clave de API y llama al modelo qwen-audio-3.0-tts-plus o qwen-audio-3.0-tts-flash a través del endpoint del mercado de modelos. Una estrategia razonable es empezar con Flash para comprobar si su latencia encaja y después ejecutar los mismos guiones con Plus para comparar. La versión adecuada depende de si tu producto requiere interacción en directo o narración que el oyente consume de principio a fin.
Los equipos que ya enrutan varios proveedores mediante un agregador compatible como AIReiter, para centralizar la facturación, pueden añadirlo allí en vez de abrir una cuenta independiente en Alibaba. Ir directamente al proveedor es lo más simple si es el único modelo que necesitas.
Si lo que buscas es conversación en tiempo real y no narración puntual, el modelo TTS es solo una capa: la API omni Realtime y el ASR en streaming que lo acompañan se explican en la guía de Qwen Audio 3 Realtime.
¿Merece la pena usarlo?
- Elige Plus si generas narraciones, audiolibros o doblajes en chino, dialectos chinos o varios idiomas, y buscas la mayor naturalidad por cada dólar.
- Elige Flash si estás creando un agente de voz en tiempo real donde un primer paquete de ~300 ms importa más que los últimos puntos de Elo de calidad.
- Valora Gemini 3.1 Flash TTS o Simba 3.2 si el coste es el criterio decisivo y una calidad cercana a la cima es suficiente: ambos son más baratos que Plus.
- Mantente con ElevenLabs o Cartesia si dependes de sus SDK más maduros, bibliotecas más amplias de voces predefinidas o herramientas y ecosistemas centrados en inglés, ámbitos en los que siguen liderando independientemente de su posición en el arena.
Entre los modelos comparados aquí, solo Plus reúne un primer puesto en el arena, 20 regiones dialectales chinas y un precio de 27,6 $ por millón de caracteres. Por eso, si esa combinación encaja con tu caso de uso, merece la pena probar tus propios guiones antes de comprometerte, en lugar de aceptar el ranking sin más.
Preguntas frecuentes
¿Qwen-Audio-3.0-TTS es gratuito?
No. Las versiones alojadas Plus y Flash son de pago y se facturan por carácter a través de Alibaba Cloud Model Studio; Plus cuesta 27,6 $ por millón de caracteres. Alibaba Cloud ha ofrecido periódicamente cuotas de prueba gratuitas, así que revisa la consola para comprobar las promociones actuales en tu región. Qwen3-TTS, con pesos abiertos, puede autoalojarse gratis.
¿Qwen-Audio-3.0-TTS es de código abierto? ¿Se puede descargar?
Las versiones alojadas Qwen-Audio-3.0-TTS-Plus/Flash no se distribuyen como pesos. El modelo de código abierto es la familia anterior Qwen3-TTS, disponible en GitHub y Hugging Face para uso local, clonación y flujos de trabajo con ComfyUI. Son lanzamientos relacionados, pero distintos.
¿Admite clonación de voz?
Sí. Clona una voz objetivo a partir de audio de referencia y está ajustado específicamente para mantener el rendimiento cuando esa referencia tiene ruido o reverberación, sin necesidad de una fase de limpieza independiente. La similitud de hablante de Plus promedia 82,75 en 16 idiomas.
Qwen-Audio-3.0-TTS frente a Qwen3-TTS-Flash: ¿qué diferencia hay?
Qwen3-TTS-Flash forma parte de la generación anterior de pesos abiertos y aparece mucho más abajo en el arena, con un Elo de ~929. Qwen-Audio-3.0-TTS es la nueva generación alojada: Flash prioriza baja latencia y Plus lidera la clasificación de calidad con un Elo de 1.237.
¿Hay demo o compatibilidad con ComfyUI?
Qwen3-TTS, la versión de pesos abiertos, cuenta con una demo pública en Hugging Face y nodos comunitarios para ComfyUI. Las versiones alojadas Qwen-Audio-3.0-TTS se utilizan desde la consola de Alibaba Cloud Model Studio, no desde una página de demostración independiente.