AIREITER
DOCS APIPREÇOS
TEMPLATES
  • AIReiter
  • Blog
  • Qwen-Audio-3.0-TTS: o modelo de TTS que lidera a Arena

Qwen-Audio-3.0-TTS: o modelo de TTS que lidera a Arena

Última Atualização: 2026-07-22 07:44:09

Em julho de 2026, o Qwen-Audio-3.0-TTS-Plus, da Alibaba, chegou ao primeiro lugar da arena de Text-to-Speech da Artificial Analysis, com Elo de qualidade de 1.237. Ele superou Gemini 3.1 Flash TTS, do Google, MiniMax Speech 2.8 HD e Eleven v3, do ElevenLabs. O preço listado é de US$ 27,6 por milhão de caracteres: cerca de um terço do que ElevenLabs e MiniMax cobram pelas versões que ele ultrapassa. Não é o modelo mais barato do ranking, mas nenhum outro combina a qualidade nº 1 com esse preço. (Os números são de 20 de julho de 2026; posições e preços mudam com frequência, então confirme ambos antes de basear um planejamento neles.)

Ranking de Text-to-Speech da Artificial Analysis com Qwen-Audio-3.0-TTS-Plus em primeiro lugar

A seguir, veja o que é esse modelo, por que ele chegou ao topo, quanto custa e em quais casos ele faz — ou não faz — sentido.

Qwen-Audio-3.0-TTS não é Qwen3-TTS

Ao buscar por "Qwen audio 3.0 TTS", a maior parte dos resultados leva ao Qwen3-TTS, a família de voz com pesos abertos que a Alibaba lançou antes e publicou no GitHub e em uma demo no Hugging Face. É o modelo que as pessoas rodam localmente, conectam ao ComfyUI e elogiam no Reddit por clonagem de voz. Não é o produto analisado neste guia.

O Qwen-Audio-3.0-TTS é a geração mais recente, hospedada e oferecida pelo Alibaba Cloud Model Studio (Bailian), sem pesos para download. Ele vem em duas versões:

  • Plus — a versão focada em qualidade, responsável pelo 1º lugar, voltada a audiolivros, narração e dublagem, em que naturalidade pesa mais do que milissegundos.
  • Flash — a versão focada em latência, com latência até o primeiro pacote de cerca de 300 ms, feita para interações em tempo real, como agentes de voz e assistentes ao vivo.

A diferença entre as gerações é grande no mesmo ranking: o antigo Qwen3 TTS Flash tem Elo de 929, por volta da 76ª posição, enquanto o novo Plus lidera com 1.237. A linhagem da marca é a mesma, mas a categoria de modelo é outra.

As duas linhas também atendem a necessidades distintas. Se a dúvida for entre elas, esta é a divisão:

Qwen3-TTS (pesos abertos)Qwen-Audio-3.0-TTS (hospedado)
Como obterDownload dos pesos (GitHub / Hugging Face)API pelo Alibaba Cloud Model Studio
Auto-hospedagem / execução localSimNão — somente hospedado
ComfyUI e nós da comunidadeSimNão
VersõesUma única família abertaPlus (qualidade) / Flash (~300 ms)
Cobertura de idiomas~10 idiomas16 idiomas + 20 dialetos chineses
Elo de qualidade na arena~929 (Qwen3 TTS Flash)1.237 (Plus, nº 1)
Ideal paraControle local, residência de dados, experimentaçãoMáxima qualidade, dialetos e produção em escala

Prefira a linha de pesos abertos quando controle de hospedagem ou custo marginal zero forem prioridade. As versões hospedadas 3.0 fazem mais sentido quando qualidade, variedade de dialetos ou não precisar operar suas próprias GPUs falam mais alto.

O benchmark por trás do primeiro lugar

A arena da Artificial Analysis é um ranking independente baseado em preferência humana e testes cegos: ouvintes comparam clipes sem saber qual modelo os gerou, e a pontuação Elo mostra a frequência com que cada um vence.

Este era o topo da arena em 20 de julho de 2026:

PosiçãoModeloElo de qualidadePreço de API / 1M de caracteres
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1.237US$ 27,6
2Simba 3.2 (SpeechifyAI)1.232US$ 10,0
3Gemini 3.1 Flash TTS (Google)1.211US$ 18,3
4Sonic 3.5 (Cartesia)1.211US$ 49,0
8MiniMax Speech 2.8 HD1.180US$ 100,0
11ElevenLabs Eleven v31.173US$ 100,0

As métricas divulgadas pela própria Alibaba apontam na mesma direção do ranking independente. No benchmark multilíngue CV3-Eval, a empresa informa taxa média de erro de palavra/caractere de 3,96 para a versão Plus e de 3,87 para a Flash — ou seja, a fala sintetizada pode ser transcrita de volta quase tão corretamente quanto o texto de origem. A similaridade de locutor, medida de quão próxima uma voz clonada fica de sua referência, é reportada em 82,75 para o Plus nos 16 idiomas testados. Esses dois números são da Alibaba; o Elo acima, não. Use qualquer benchmark individual como ponto de partida e teste com seus próprios áudios.

Onde o modelo se destaca

A posição no ranking vem de quatro capacidades relevantes para uso em produção, documentadas na página técnica oficial do Qwen-Audio-3.0-TTS.

Visão geral dos recursos do Qwen-Audio-3.0-TTS e resultados do CV3-Eval

Controle por instruções livres. A voz pode ser guiada em linguagem natural — "leia isto como um locutor ansioso de rádio tarde da noite, mais devagar perto do fim" — com controle de papel, emoção, estilo de fala, velocidade, timbre e sotaque. Para direcionamentos gerais, não há uma linguagem de marcação separada para aprender.

Tags inline detalhadas. Quando é preciso precisão, o modelo interpreta 86 tags inline inseridas diretamente no texto, inclusive eventos não verbais como risadas, respiração, tosse e suspiros. É o tipo de recurso que separa uma leitura plana de uma interpretação e torna o modelo útil para diálogos de jogos, narração e dublagem de filmes.

Amplitude de idiomas e dialetos. O modelo cobre 16 idiomas — sete deles adicionados recentemente, incluindo árabe, indonésio, português, tailandês, vietnamita, malaio e tagalo — além de 20 regiões de dialetos chineses, de cantonês e xangaiense a sichuanês e dialetos do Nordeste. Para equipes que lançam produtos no Sudeste Asiático ou em mercados de língua chinesa, essa cobertura de dialetos é difícil de encontrar em outro lugar.

Robustez e qualidade de saída. Ele clona vozes a partir de áudios de referência ruidosos, reverberantes ou pouco claros sem exigir uma etapa separada de redução de ruído; sintetiza até três minutos em uma única passagem para narrações longas; e gera áudio em 48 kHz, cuja disponibilização no console está prevista para 24 de julho. A geração de três minutos em uma única passagem importa porque é ao unir clipes mais curtos que prosódia e timbre geralmente começam a variar.

Preço: qualidade de topo sem cobrar como topo de linha

Serviços de texto para fala são cobrados por caractere de texto de entrada, portanto o custo cresce diretamente com o volume narrado.

Por US$ 27,6 por milhão de caracteres, o Qwen-Audio-3.0-TTS-Plus custa uma fração dos dois nomes premium mais tradicionais que ele supera: ElevenLabs Eleven v3 e MiniMax Speech 2.8 HD aparecem a US$ 100 por milhão de caracteres, cerca de 3,6 vezes mais. Na prática, um audiolivro de 100.000 caracteres, aproximadamente um romance curto, custa cerca de US$ 2,76 no Plus, contra aproximadamente US$ 10 nos outros dois.

O Plus não é, porém, a opção mais barata no geral. Dois modelos logo abaixo em qualidade custam menos: Gemini 3.1 Flash TTS, a US$ 18,3 por milhão de caracteres, na 3ª posição, e Simba 3.2, a US$ 10, na 2ª posição e praticamente empatado em Elo. A forma correta de resumir é mais específica: o Qwen oferece a qualidade mais bem colocada por um preço intermediário, não o menor preço do ranking. Se alguns pontos de Elo não fizerem diferença no seu caso, dá para gastar menos. (A arena pública mostra o preço do Plus; a tarifa por caractere do Flash ainda não foi publicada ali, então consulte o console para ver o valor atual.)

Como usar o Qwen-Audio-3.0-TTS

O caminho direto é o Alibaba Cloud Model Studio (Bailian). Os formatos de requisição e SDKs estão na documentação do Model Studio: crie uma chave de API e chame o modelo qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash pelo endpoint do mercado de modelos. Um ponto de partida razoável é prototipar com o Flash para verificar se a latência atende ao caso de uso e depois executar os mesmos roteiros no Plus para comparar. A versão ideal depende de você precisar de interação ao vivo ou de uma narração que o ouvinte acompanha do início ao fim.

Equipes que já roteiam vários provedores por um agregador compatível como o AIReiter, mantendo a cobrança em uma só plataforma, podem adicioná-lo ali em vez de abrir uma conta separada na Alibaba. Ir direto é mais simples se este for o único modelo de que você precisa.

Se você precisa de conversa em tempo real, e não de narração em uma única geração, o TTS é apenas uma camada: a API omni Realtime e o ASR por streaming que trabalham com ele são abordados no guia sobre Qwen Audio 3 Realtime.

Vale a pena usar?

  • Escolha o Plus se você gera narrações, audiolivros ou dublagens em chinês, dialetos chineses ou vários idiomas e busca a maior naturalidade por dólar.
  • Escolha o Flash se você está criando um agente de voz em tempo real e o primeiro pacote em ~300 ms importa mais do que os últimos pontos de Elo em qualidade.
  • Considere Gemini 3.1 Flash TTS ou Simba 3.2 se custo for o critério decisivo e uma qualidade próxima do topo já bastar — ambos custam menos que o Plus.
  • Fique com ElevenLabs ou Cartesia se você depende de seus SDKs maduros, bibliotecas maiores de vozes prontas ou ferramentas e ecossistemas voltados primeiro ao inglês, áreas em que eles continuam à frente independentemente da posição na arena.

Entre os modelos comparados aqui, só o Plus reúne o 1º lugar na arena, 20 regiões de dialetos chineses e preço de US$ 27,6/M. Por isso, se essa combinação fizer sentido para seu caso, vale testar seus próprios roteiros antes de se comprometer, em vez de aceitar o ranking sem validação.

Perguntas frequentes

O Qwen-Audio-3.0-TTS é gratuito?

Não. As versões hospedadas Plus e Flash são pagas e cobradas por caractere pelo Alibaba Cloud Model Studio; o Plus custa US$ 27,6 por milhão de caracteres. A Alibaba Cloud oferece periodicamente cotas gratuitas de teste, então consulte o console para verificar uma oferta atual na sua região. O Qwen3-TTS de pesos abertos pode ser auto-hospedado gratuitamente.

O Qwen-Audio-3.0-TTS é open source? Posso baixá-lo?

As versões hospedadas Qwen-Audio-3.0-TTS-Plus/Flash não são distribuídas como pesos. O modelo open source é a família anterior Qwen3-TTS, disponível no GitHub e no Hugging Face para uso local, clonagem e fluxos de trabalho no ComfyUI. São lançamentos relacionados, mas separados.

Ele oferece clonagem de voz?

Sim. Ele clona uma voz-alvo a partir de um áudio de referência e foi ajustado especificamente para funcionar bem quando essa referência tem ruído ou reverberação, sem precisar de uma etapa de limpeza separada. A similaridade de locutor média é de 82,75 na versão Plus, considerando 16 idiomas.

Qwen-Audio-3.0-TTS vs Qwen3-TTS-Flash: qual é a diferença?

Qwen3-TTS-Flash faz parte da geração anterior de pesos abertos e aparece muito mais abaixo na arena, com Elo de ~929. Qwen-Audio-3.0-TTS é a nova geração hospedada: sua versão Flash prioriza baixa latência, enquanto a Plus lidera o ranking de qualidade com Elo de 1.237.

Há demo ou suporte ao ComfyUI?

O Qwen3-TTS de pesos abertos tem uma demo pública no Hugging Face e nós de ComfyUI criados pela comunidade. As versões hospedadas Qwen-Audio-3.0-TTS são acessadas pelo console do Alibaba Cloud Model Studio, e não por uma página de demonstração independente.

>_Diretório de modelos AIReiter

Acesso API rápido aos modelos relacionados a este guia

Gemini 3.1 Pro

Chat
GoogleCriar API Key >

Gemini 3 Pro

Chat
GoogleCriar API Key >

Claude Fable 5

Chat

Um modelo premium Claude para raciocínio profundo e trabalhos complexos de longo formato.

AnthropicCriar API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicCriar API Key >

Claude Opus 4.8

Chat

Um modelo Claude de alta capacidade para raciocínio exigente e trabalho profissional.

AnthropicCriar API Key >

Posts recentes

OpenRouter US In-Region Routing: configuração e limites

2026-09-10

Alternativas ao Civitai: Hugging Face, Tensor.Art, SeaArt e ComfyUI

2026-09-10

Preços da API Kling: custo oficial vs. agregadores (2026)

2026-09-10

Guia do OpenRouter Shell Tool e da Files API (Beta)

2026-09-10
AIREITER

Dúvidas? Entre em contato em
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

Vídeo IA

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

Imagem IA

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Blog

Ver Tudo →

Empresa

Política de PrivacidadeTermos de ServiçoPolítica de Reembolso

© 2026 AIReiter. Todos os direitos reservados.