AIREITER
DOCS APIPRECIOS
PLANTILLAS
  • AIReiter
  • Blog
  • Qwen-Audio-3.0-TTS: el modelo TTS que lidera el arena

Qwen-Audio-3.0-TTS: el modelo TTS que lidera el arena

Última actualización: 2026-07-22 07:42:58

En julio de 2026, Qwen-Audio-3.0-TTS-Plus de Alibaba alcanzó el primer puesto del arena de Text-to-Speech de Artificial Analysis, con un Quality Elo de 1.237. Superó a Gemini 3.1 Flash TTS de Google, MiniMax Speech 2.8 HD y Eleven v3 de ElevenLabs. Su precio publicado es de 27,6 $ por millón de caracteres: aproximadamente un tercio de lo que cobran ElevenLabs y MiniMax por las versiones a las que adelanta. No es el modelo más barato de la tabla, pero ningún otro combina la calidad nº 1 con ese precio. (Las cifras corresponden al 20 de julio de 2026; los proveedores cambian con frecuencia de posición y tarifas, así que conviene verificar ambos datos antes de tomar decisiones.)

Clasificación de Text-to-Speech de Artificial Analysis con Qwen-Audio-3.0-TTS-Plus en primer lugar

Veamos qué es este modelo, por qué ha logrado ese puesto, cuánto cuesta y en qué casos merece la pena —o no— elegirlo.

No es lo mismo que Qwen3-TTS

Si buscas "Qwen audio 3.0 TTS", la mayoría de resultados te llevarán a Qwen3-TTS, la familia de voz con pesos abiertos que Alibaba lanzó antes y publicó en GitHub y en una demo de Hugging Face. Es el modelo que la gente ejecuta en local, integra con ComfyUI y comenta en Reddit por sus capacidades de clonación de voz. No es el mismo producto que analizamos aquí.

Qwen-Audio-3.0-TTS es la generación más reciente y alojada, disponible mediante Alibaba Cloud Model Studio (Bailian) en lugar de como pesos descargables. Se ofrece en dos variantes:

  • Plus — la versión centrada en calidad, y la que ocupa el nº 1, pensada para audiolibros, narración y doblaje cuando la naturalidad importa más que unos milisegundos.
  • Flash — la versión orientada a latencia, con una latencia hasta el primer paquete de unos 300 ms, diseñada para interacción en tiempo real, como agentes de voz y asistentes en directo.

La diferencia generacional salta a la vista en la misma clasificación: el anterior Qwen3 TTS Flash registra un Elo de 929 aproximadamente, en torno al puesto 76, mientras que el nuevo nivel Plus lidera con 1.237. Comparten linaje de marca, pero pertenecen a categorías distintas.

También responden a necesidades diferentes. Si estás dudando entre ambos, esta es la comparación clave:

Qwen3-TTS (pesos abiertos)Qwen-Audio-3.0-TTS (alojado)
Cómo se obtieneDescarga de pesos (GitHub / Hugging Face)API mediante Alibaba Cloud Model Studio
Autoalojamiento / ejecución localSíNo — solo alojado
ComfyUI y nodos de la comunidadSíNo
VersionesUna única familia abiertaPlus (calidad) / Flash (~300 ms)
Cobertura de idiomas~10 idiomas16 idiomas + 20 dialectos chinos
Quality Elo en el arena~929 (Qwen3 TTS Flash)1.237 (Plus, nº 1)
Ideal paraControl local, residencia de datos y experimentaciónMáxima calidad, dialectos y producción a escala

Elige la línea de pesos abiertos si priorizas el control sobre el alojamiento o un coste marginal cero. Las versiones alojadas 3.0 tienen más sentido si pesan más la calidad, la amplitud dialectal o evitar gestionar tus propias GPU.

El benchmark detrás del primer puesto

El arena de Artificial Analysis es una clasificación independiente basada en preferencias humanas a ciegas: los oyentes comparan fragmentos sin saber qué modelo los ha generado, y la puntuación Elo refleja la frecuencia con que gana cada uno.

Así estaba la parte alta de la clasificación el 20 de julio de 2026:

PuestoModeloQuality EloPrecio de API / 1 M de caracteres
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1.23727,6 $
2Simba 3.2 (SpeechifyAI)1.23210,0 $
3Gemini 3.1 Flash TTS (Google)1.21118,3 $
4Sonic 3.5 (Cartesia)1.21149,0 $
8MiniMax Speech 2.8 HD1.180100,0 $
11ElevenLabs Eleven v31.173100,0 $

Las métricas comunicadas por Alibaba apuntan en la misma dirección que la clasificación independiente. En el benchmark multilingüe CV3-Eval, el proveedor informa de una tasa media de error de palabra/caracteres de 3,96 para Plus y de 3,87 para Flash; es decir, el audio sintetizado se transcribe de vuelta casi con la misma precisión que el texto original. La similitud de hablante, que mide el parecido entre una voz clonada y su referencia, alcanza 82,75 en Plus entre los 16 idiomas evaluados. Estas dos cifras proceden de Alibaba; el Elo anterior, no. Cualquier benchmark aislado debe tomarse como punto de partida y contrastarse con tu propio audio.

Sus puntos fuertes en producción

El resultado en el ranking se apoya en cuatro capacidades relevantes para uso real, documentadas en la página técnica oficial de Qwen-Audio-3.0-TTS.

Resumen de capacidades y resultados de CV3-Eval de Qwen-Audio-3.0-TTS

Control mediante instrucciones naturales. Puedes guiar la voz con lenguaje cotidiano —"lee esto como un locutor de radio nervioso en plena madrugada, más despacio hacia el final"— y definir el personaje, la emoción, el estilo de habla, la velocidad, el timbre y el acento. Para los ajustes generales no hay que aprender un lenguaje de marcado específico.

Etiquetas integradas de control fino. Cuando se necesita precisión, el modelo interpreta 86 etiquetas insertadas directamente en el texto, incluidos eventos no verbales como risas, respiraciones, tos y suspiros. Es la diferencia entre una lectura plana y una interpretación; también lo que lo hace útil para diálogos de videojuegos, narración y doblaje cinematográfico.

Amplia cobertura lingüística y dialectal. Admite 16 idiomas, siete de ellos incorporados recientemente, entre los que figuran árabe, indonesio, portugués, tailandés, vietnamita, malayo y tagalo. Añade además 20 regiones dialectales chinas, desde cantonés y shanghainés hasta sichuanés y nororiental. Para equipos que publican en el Sudeste Asiático o en mercados de habla china, esa cobertura dialectal es difícil de igualar.

Solidez y calidad de salida. Clona voces incluso a partir de audios de referencia con ruido, reverberación o poca claridad, sin requerir un paso independiente de reducción de ruido. Puede sintetizar hasta tres minutos en una sola pasada para narraciones largas y genera audio a 48 kHz; el despliegue de 48 kHz en la consola está previsto para el 24 de julio. La generación en una única pasada durante tres minutos importa porque al unir clips más cortos es habitual que se desajusten la prosodia y el timbre.

Precio: calidad líder sin tarifa prémium

Los servicios de texto a voz se facturan por caracteres de texto de entrada, de modo que el coste crece de forma directa con el volumen narrado.

Con 27,6 $ por millón de caracteres, Qwen-Audio-3.0-TTS-Plus cuesta una fracción de lo que cobran dos nombres prémium consolidados a los que supera: ElevenLabs Eleven v3 y MiniMax Speech 2.8 HD figuran ambos a 100 $ por millón de caracteres, unas 3,6 veces más. En términos prácticos, un audiolibro de 100.000 caracteres, aproximadamente una novela corta, costaría unos 2,76 $ con Plus, frente a unos 10 $ con esos dos servicios.

Plus no es, eso sí, la opción más económica en términos absolutos. Dos modelos con una calidad algo inferior tienen tarifas menores: Gemini 3.1 Flash TTS cuesta 18,3 $ por millón de caracteres y ocupa el puesto 3, mientras que Simba 3.2 cuesta 10 $ y está en el puesto 2, casi empatado en Elo. La lectura correcta es más concreta: Qwen ofrece la calidad mejor clasificada a un precio intermedio, no el precio más bajo de la tabla. Si unos pocos puntos de Elo no son determinantes para tu caso, puedes pagar menos. (El arena público muestra el precio de Plus; todavía no publica la tarifa por carácter de Flash, así que consulta la consola para ver el importe vigente.)

Cómo usar Qwen-Audio-3.0-TTS

La vía directa es Alibaba Cloud Model Studio (Bailian). Los formatos de solicitud y los SDK están en la documentación de Model Studio: crea una clave de API y llama al modelo qwen-audio-3.0-tts-plus o qwen-audio-3.0-tts-flash a través del endpoint del mercado de modelos. Una estrategia razonable es empezar con Flash para comprobar si su latencia encaja y después ejecutar los mismos guiones con Plus para comparar. La versión adecuada depende de si tu producto requiere interacción en directo o narración que el oyente consume de principio a fin.

Los equipos que ya enrutan varios proveedores mediante un agregador compatible como AIReiter, para centralizar la facturación, pueden añadirlo allí en vez de abrir una cuenta independiente en Alibaba. Ir directamente al proveedor es lo más simple si es el único modelo que necesitas.

Si lo que buscas es conversación en tiempo real y no narración puntual, el modelo TTS es solo una capa: la API omni Realtime y el ASR en streaming que lo acompañan se explican en la guía de Qwen Audio 3 Realtime.

¿Merece la pena usarlo?

  • Elige Plus si generas narraciones, audiolibros o doblajes en chino, dialectos chinos o varios idiomas, y buscas la mayor naturalidad por cada dólar.
  • Elige Flash si estás creando un agente de voz en tiempo real donde un primer paquete de ~300 ms importa más que los últimos puntos de Elo de calidad.
  • Valora Gemini 3.1 Flash TTS o Simba 3.2 si el coste es el criterio decisivo y una calidad cercana a la cima es suficiente: ambos son más baratos que Plus.
  • Mantente con ElevenLabs o Cartesia si dependes de sus SDK más maduros, bibliotecas más amplias de voces predefinidas o herramientas y ecosistemas centrados en inglés, ámbitos en los que siguen liderando independientemente de su posición en el arena.

Entre los modelos comparados aquí, solo Plus reúne un primer puesto en el arena, 20 regiones dialectales chinas y un precio de 27,6 $ por millón de caracteres. Por eso, si esa combinación encaja con tu caso de uso, merece la pena probar tus propios guiones antes de comprometerte, en lugar de aceptar el ranking sin más.

Preguntas frecuentes

¿Qwen-Audio-3.0-TTS es gratuito?

No. Las versiones alojadas Plus y Flash son de pago y se facturan por carácter a través de Alibaba Cloud Model Studio; Plus cuesta 27,6 $ por millón de caracteres. Alibaba Cloud ha ofrecido periódicamente cuotas de prueba gratuitas, así que revisa la consola para comprobar las promociones actuales en tu región. Qwen3-TTS, con pesos abiertos, puede autoalojarse gratis.

¿Qwen-Audio-3.0-TTS es de código abierto? ¿Se puede descargar?

Las versiones alojadas Qwen-Audio-3.0-TTS-Plus/Flash no se distribuyen como pesos. El modelo de código abierto es la familia anterior Qwen3-TTS, disponible en GitHub y Hugging Face para uso local, clonación y flujos de trabajo con ComfyUI. Son lanzamientos relacionados, pero distintos.

¿Admite clonación de voz?

Sí. Clona una voz objetivo a partir de audio de referencia y está ajustado específicamente para mantener el rendimiento cuando esa referencia tiene ruido o reverberación, sin necesidad de una fase de limpieza independiente. La similitud de hablante de Plus promedia 82,75 en 16 idiomas.

Qwen-Audio-3.0-TTS frente a Qwen3-TTS-Flash: ¿qué diferencia hay?

Qwen3-TTS-Flash forma parte de la generación anterior de pesos abiertos y aparece mucho más abajo en el arena, con un Elo de ~929. Qwen-Audio-3.0-TTS es la nueva generación alojada: Flash prioriza baja latencia y Plus lidera la clasificación de calidad con un Elo de 1.237.

¿Hay demo o compatibilidad con ComfyUI?

Qwen3-TTS, la versión de pesos abiertos, cuenta con una demo pública en Hugging Face y nodos comunitarios para ComfyUI. Las versiones alojadas Qwen-Audio-3.0-TTS se utilizan desde la consola de Alibaba Cloud Model Studio, no desde una página de demostración independiente.

>_Directorio de modelos AIReiter

Acceso API rápido a modelos relacionados con esta guía

Gemini 3.1 Pro

Chat
GoogleCrear API Key >

Gemini 3 Pro

Chat
GoogleCrear API Key >

Claude Fable 5

Chat

Un modelo premium de Claude para razonamiento profundo y trabajo complejo de formato largo.

AnthropicCrear API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCrear API Key >

Claude Opus 4.8

Chat

Un modelo Claude de alta capacidad para tareas que exigen razonamiento y trabajo profesional.

AnthropicCrear API Key >

Publicaciones recientes

OpenRouter US In-Region Routing: configuración y límites

2026-09-10

Alternativas a Civitai: Hugging Face, Tensor.Art, SeaArt y ComfyUI

2026-09-10

Precios de la API de Kling: coste oficial frente a agregadores (2026)

2026-09-10

Guía de OpenRouter Shell Tool y Files API (Beta)

2026-09-10
AIREITER

¿Preguntas? Contáctanos en
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Video IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagen IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Ver todo →

Compañía

Política de privacidadTérminos de servicioPolítica de reembolso

© 2026 AIReiter. Todos los derechos reservados.