2026년 7월, Alibaba의 Qwen-Audio-3.0-TTS-Plus는 Artificial Analysis Text-to-Speech arena에서 Quality Elo 1,237로 1위를 차지하며 Google의 Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD, 그리고 ElevenLabs의 Eleven v3를 앞섰습니다. 또한 백만 문자당 $27.6로 표시되어 있으며, 이는 자신보다 낮은 순위의 상위 티어에 대해 ElevenLabs와 MiniMax가 청구하는 가격의 대략 3분의 1 수준입니다. 보드에서 가장 저렴한 모델은 아니지만, 이 가격에 1위 수준의 품질을 함께 제공하는 다른 모델은 없습니다. (수치는 2026년 7월 20일 기준입니다. 공급업체는 순위와 가격을 자주 변경하므로, 이를 기준으로 계획하기 전에 두 가지를 모두 확인하세요.)
아래에는 이 모델이 무엇인지, 어떻게 그 순위를 얻었는지, 비용은 얼마인지, 그리고 언제 적합한 선택인지 — 또는 그렇지 않은지 —가 나와 있습니다.
먼저, 이것을 Qwen3-TTS와 혼동하지 마세요
"Qwen audio 3.0 TTS"를 검색하면 대부분의 결과가 Qwen3-TTS를 가리킵니다. 이는 Alibaba가 이전에 공개하고 GitHub와 Hugging Face 데모에 게시한 오픈 웨이트 음성 패밀리입니다. 사람들이 로컬에서 실행하고 ComfyUI에 연결하며, 음성 클로닝 때문에 Reddit에서 극찬하는 모델이 바로 이것입니다. 이 가이드에 나온 제품과는 다른 제품입니다.
Qwen-Audio-3.0-TTS는 다운로드 가능한 가중치 형태가 아니라 Alibaba Cloud Model Studio (Bailian)를 통해 제공되는 최신 호스팅 생성 모델입니다. 이는 두 가지 티어로 제공됩니다:
- Plus — 품질 우선 등급(1위 순위를 차지하는 등급)으로, 자연스러움이 밀리초보다 더 중요한 오디오북, 내레이션, 더빙에 적합합니다.
- Flash — 지연 시간 우선 등급으로, 첫 패킷 지연 시간이 약 300 ms이며, 음성 에이전트와 라이브 어시스턴트 같은 실시간 상호작용을 위해 설계되었습니다.
같은 리더보드에서 세대 차이는 뚜렷합니다: 더 오래된 Qwen3 TTS Flash는 Elo 929(순위 약 76위)에 머무는 반면, 새로운 Plus 티어는 1,237로 선두를 달리고 있습니다. 같은 브랜드 계열이지만, 모델의 급이 다릅니다.
둘은 서로 다른 역할도 합니다. 둘 중 하나를 선택하는 경우, 구분은 다음과 같습니다:
| Qwen3-TTS (open-weight) | Qwen-Audio-3.0-TTS (hosted) | |
|---|---|---|
| How you get it | 가중치 다운로드 (GitHub / Hugging Face) | Alibaba Cloud Model Studio를 통한 API |
| Self-host / run locally | 예 | 아니요 — 호스팅 전용 |
| ComfyUI & community nodes | 예 | 아니요 |
| Tiers | 단일 오픈 패밀리 | Plus (quality) / Flash (~300 ms) |
| Language coverage | ~10개 언어 | 16개 언어 + 20개 중국어 방언 |
| Arena Quality Elo | ~929 (Qwen3 TTS Flash) | 1,237 (Plus, #1) |
| Best for | 로컬 제어, 데이터 상주, 실험 | 최고 품질, 방언, 대규모 프로덕션 |
호스팅 제어나 추가 한계 비용이 가장 중요할 때는 오픈 가중치 라인을 선택하세요. 품질, 방언 범위, 또는 자체 GPU를 운영하지 않는 것이 더 중요할 때는 호스팅된 3.0 티어를 선택하세요.
그 순위를 얻은 벤치마크
Artificial Analysis 아레나는 독립적인 제3자가 운영하는 블라인드 인간 선호도 순위입니다: 청취자들은 어떤 모델이 생성했는지 모른 채 클립을 비교하며, Elo 점수는 각 항목이 얼마나 자주 승리하는지를 반영합니다.
2026년 7월 20일 기준 아레나 상위는 다음과 같습니다:
| 순위 | 모델 | 품질 Elo | API 가격 / 100만 문자 |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
알리바바가 자체적으로 보고한 지표도 독립적인 순위와 같은 방향을 가리킵니다. 다국어 CV3-Eval 벤치마크에서, 벤더는 Plus 티어의 평균 word/character error rate를 3.96, Flash 티어를 3.87로 보고합니다. 이는 합성된 음성이 원본 텍스트와 거의 동일한 정확도로 다시 전사된다는 뜻입니다. 복제된 음성이 참조 음성과 얼마나 비슷한지를 측정하는 지표인 speaker similarity는 테스트한 16개 언어 전체에서 Plus 기준 82.75로 보고됩니다. 이 두 수치는 알리바바 자체의 것이며, 위의 Elo는 그렇지 않습니다. 어떤 단일 벤치마크든 출발점으로만 보고, 직접 보유한 오디오로 테스트하세요.
잘하는 점
이 순위는 운영 환경에서 중요한 네 가지 기능에서 비롯되며, 공식 Qwen-Audio-3.0-TTS 기술 페이지에 문서화되어 있습니다.
자유 형식의 지시 제어. 역할, 감정, 말투, 속도, 음색, 억양까지 포함하여 평이한 언어로 음성을 조정할 수 있습니다 — "이것을 불안한 심야 라디오 진행자처럼 읽되, 끝부분에서는 더 천천히"처럼 말하면 됩니다. 큰 틀을 익히기 위해 별도의 마크업 언어를 배울 필요가 없습니다.
세분화된 인라인 태그. 정밀한 제어를 위해 모델은 텍스트에 직접 배치된 86개의 인라인 태그를 읽으며, 여기에는 웃음, 숨쉬기, 기침, 한숨과 같은 비언어적 이벤트도 포함됩니다. 이것이 평면적인 낭독과 연기의 차이를 만들어 내며, 게임 대사, 나레이션, 영화 더빙에 모델을 사용할 수 있게 하는 요소입니다.
언어 및 방언의 폭. 아랍어, 인도네시아어, 포르투갈어, 태국어, 베트남어, 말레이어, 타갈로그어를 포함해 새로 추가된 7개를 포함한 16개 언어와, 광둥어와 상하이어부터 쓰촨어와 동북 방언까지 20개의 중국어 방언 지역을 지원합니다. 동남아시아나 중국어권 시장 전반에 제품을 출시하는 팀에게는 이 방언 커버리지를 따라올 곳이 거의 없습니다.
강건성과 출력 품질. 별도의 노이즈 제거 단계 없이 잡음이 있거나 잔향이 심하거나 불분명한 기준 오디오에서도 음성을 클론하며, 긴 형식의 나레이션을 위해 한 번의 패스로 최대 3분까지 합성하고, 48 kHz 오디오를 출력합니다(48 kHz에 대한 콘솔 배포는 7월 24일로 예정되어 있습니다). 3분 단일 패스 생성이 중요한 이유는 더 짧은 클립들을 이어 붙이는 과정에서 보통 운율과 음색이 달라지기 때문입니다.
가격: 최고급 요금 없이 최고 품질
텍스트 음성 변환은 입력 텍스트의 문자 수를 기준으로 과금되므로, 비용은 낭독하는 분량에 비례해 직접적으로 증가합니다.
백만 문자당 $27.6인 Qwen-Audio-3.0-TTS-Plus는 이를 앞서는 두 기존 프리미엄 제품, 즉 ElevenLabs Eleven v3와 MiniMax Speech 2.8 HD가 모두 백만 문자당 $100으로 책정된 것에 비해 훨씬 저렴합니다. 이는 약 3.6배 더 비싼 수준입니다. 실제로 100,000자 오디오북(대략 단편 소설 분량)의 경우 Plus에서는 약 $2.76이 들며, 이 두 제품에서는 약 $10이 듭니다.
하지만 Plus가 전체적으로 가장 저렴한 옵션은 아닙니다. 품질 면에서 한 단계 아래인 두 모델이 더 저렴합니다. Gemini 3.1 Flash TTS는 백만 자당 $18.3(rank 3), Simba 3.2는 $10(rank 2, Elo 기준 거의 동률)입니다. 따라서 정확한 표현은 제한적입니다. 즉, Qwen은 중간 가격대에서 최고 순위의 품질을 제공하지만, 시장에서 가장 낮은 가격은 아닙니다. 사용 사례상 Elo 몇 점 차이가 중요하지 않다면 더 적게 지불할 수 있습니다. (공개 아레나는 Plus의 가격만 표시하며, Flash의 문자당 요금은 아직 거기에 공개되어 있지 않으므로 실시간 Flash 금액은 콘솔에서 확인하세요.)
Qwen-Audio-3.0-TTS를 사용하는 방법
직접 경로는 Alibaba Cloud Model Studio (Bailian)이며, 요청 형식과 SDK는 Model Studio documentation에 있습니다: API key를 발급한 다음 model-market endpoint를 통해 qwen-audio-3.0-tts-plus 또는 qwen-audio-3.0-tts-flash 모델을 호출합니다. 합리적인 출발점은 Flash에서 프로토타입을 만들어 지연 시간이 적절한지 확인한 뒤, 동일한 스크립트를 Plus로 실행해 비교해 보는 것입니다. 적합한 등급은 사용 사례가 실시간 상호작용인지, 아니면 청취자가 처음부터 끝까지 듣는 내레이션인지에 따라 달라집니다.
이미 AIReiter와 같은 호환 가능한 집계기를 통해 여러 제공업체를 라우팅하여 청구를 한 곳에서 관리하고 있는 팀이라면, 별도의 Alibaba 계정을 개설하는 대신 그곳에 추가할 수 있습니다. 이 모델만 필요하다면 직접 사용하는 것이 가장 간단합니다.
한 번의 내레이션이 아니라 실시간 대화가 필요하다면, TTS model은 전체의 한 계층일 뿐입니다 — 그와 함께 사용하는 omni Realtime API와 streaming ASR은 Qwen Audio 3 Realtime guide에서 다룹니다.
사용해야 할까요?
- Plus를 선택하세요. 중국어, 방언 또는 다국어 내레이션, 오디오북, 더빙을 생성하며, 달러당 가장 높은 자연스러움을 원한다면 적합합니다.
- Flash를 선택하세요. 약 300ms의 첫 패킷이 품질의 마지막 몇 Elo 포인트보다 더 중요한 실시간 음성 에이전트를 구축하는 경우 적합합니다.
- Gemini 3.1 Flash TTS 또는 Simba 3.2를 살펴보세요. 비용이 결정적인 요소이고 최상위에 가까운 품질이면 충분하다면 적합합니다 — 둘 다 Plus보다 저렴합니다.
- ElevenLabs 또는 Cartesia를 계속 사용하세요. 성숙한 SDK, 더 큰 사전 구축 음성 라이브러리, 또는 영어 우선 도구와 생태계에 의존하며, 아레나 순위와 관계없이 여전히 이들이 앞서는 경우 적합합니다.
여기 비교된 모델들 중에서, #1 arena 순위, 20개의 중국 방언 지역, 그리고 $27.6/M 가격의 조합은 Plus만 제공하는 것입니다. 그래서 이 조합이 귀하의 사용 사례에 맞는다면, 순위를 그대로 믿고 넘어가기보다 커밋하기 전에 직접 스크립트를 실행해 보는 것이 가치가 있습니다.
자주 묻는 질문
Qwen-Audio-3.0-TTS는 무료인가요?
아니요 — 호스팅되는 Plus 및 Flash 요금제는 유료이며, Alibaba Cloud Model Studio를 통해 문자 수 기준으로 청구됩니다. Plus의 경우 백만 문자당 $27.6입니다. Alibaba Cloud는 정기적으로 무료 체험 할당량을 제공해 왔으므로, 해당 지역의 현재 제공 사항은 콘솔에서 확인하세요. 오픈 가중치 Qwen3-TTS는 자체 호스팅 시 무료입니다.
Qwen-Audio-3.0-TTS는 오픈 소스인가요? 다운로드할 수 있나요?
호스팅된 Qwen-Audio-3.0-TTS-Plus/Flash 계층은 가중치 형태로 배포되지 않습니다. 오픈소스 모델은 이전 Qwen3-TTS 계열로, GitHub와 Hugging Face에서 로컬 사용, 복제, ComfyUI 워크플로우용으로 제공됩니다. 이들은 관련이 있지만 별도의 릴리스입니다.
음성 복제를 지원하나요?
네. 참조 오디오에서 대상 음성을 복제하며, 해당 참조가 노이즈가 있거나 잔향이 있는 경우에도 견디도록 특별히 튜닝되어 있어 별도의 정리 단계가 필요하지 않습니다. 화자 유사도는 Plus 요금제에서 16개 언어 기준 평균 82.75입니다.
Qwen-Audio-3.0-TTS vs Qwen3-TTS-Flash — 차이점은 무엇인가요?
Qwen3-TTS-Flash는 이전의 오픈 웨이트 세대에 속하며, 아레나에서 훨씬 낮은 순위(Elo ~929)에 위치합니다. Qwen-Audio-3.0-TTS는 새로운 호스팅 세대이며, Flash 계층은 낮은 지연 시간을 목표로 하고, Plus 계층은 Elo 1,237로 품질 순위에서 가장 높습니다.
데모나 ComfyUI 지원이 있나요?
오픈 웨이트 Qwen3-TTS는 공개 Hugging Face 데모와 커뮤니티 ComfyUI 노드를 제공합니다. 호스팅되는 Qwen-Audio-3.0-TTS 티어는 독립적인 데모 페이지가 아니라 Alibaba Cloud Model Studio 콘솔을 통해 액세스됩니다.
