2026년 7월, Alibaba의 Qwen-Audio-3.0-TTS-Plus가 Artificial Analysis Text-to-Speech 아레나에서 Quality Elo 1,237점으로 1위를 차지했습니다. Google Gemini 3.1 Flash TTS, MiniMax Speech 2.8 HD, ElevenLabs Eleven v3를 앞선 결과입니다. 가격은 100만 자당 $27.6로, 순위에서 앞선 ElevenLabs 및 MiniMax의 해당 티어 대비 약 3분의 1 수준입니다. 최저가 모델은 아니지만, 아레나 1위 품질을 이 가격에 제공하는 모델은 현재 없습니다. (수치는 2026년 7월 20일 기준입니다. 공급사별 순위와 가격은 자주 바뀌므로 도입 계획 전 다시 확인하는 편이 좋습니다.)
이 글에서는 Qwen-Audio-3.0-TTS가 어떤 모델인지, 1위를 기록한 배경과 가격, 그리고 어떤 경우에 적합하거나 적합하지 않은지를 정리합니다.
Qwen3-TTS와는 다른 모델이다
"Qwen audio 3.0 TTS"를 검색하면 대개 Qwen3-TTS가 먼저 나옵니다. 이는 Alibaba가 앞서 공개한 오픈 웨이트 음성 모델 제품군으로, GitHub와 Hugging Face 데모에서 확인할 수 있습니다. 로컬에서 실행하거나 ComfyUI에 연결하고, 음성 복제 용도로 Reddit에서 자주 언급되는 모델도 바로 이쪽입니다. 하지만 이 글에서 다루는 모델과는 별개입니다.
Qwen-Audio-3.0-TTS는 다운로드 가능한 웨이트 대신 Alibaba Cloud Model Studio (Bailian)를 통해 제공되는 최신 호스팅형 세대입니다. 두 가지 티어로 나뉩니다.
- Plus — 자연스러움을 최우선으로 하는 고품질 티어입니다. 아레나 1위를 기록한 모델이며, 수 밀리초의 차이보다 음질이 중요한 오디오북, 내레이션, 더빙에 맞습니다.
- Flash — 지연 시간을 우선한 티어입니다. 첫 패킷 지연 시간은 약 300ms이며, 음성 에이전트나 실시간 어시스턴트 같은 대화형 서비스용으로 설계됐습니다.
같은 리더보드에서 세대 차이는 분명합니다. 이전 세대인 Qwen3 TTS Flash는 Elo 929점, 약 76위에 머무는 반면 새 Plus 티어는 1,237점으로 선두입니다. 브랜드 계보는 이어지지만 모델의 급은 다릅니다.
두 제품군의 쓰임새도 다릅니다. 선택 기준을 표로 정리하면 다음과 같습니다.
| Qwen3-TTS (오픈 웨이트) | Qwen-Audio-3.0-TTS (호스팅형) | |
|---|---|---|
| 이용 방식 | 웨이트 다운로드 (GitHub / Hugging Face) | Alibaba Cloud Model Studio API |
| 자체 호스팅 / 로컬 실행 | 가능 | 불가 — 호스팅형 전용 |
| ComfyUI 및 커뮤니티 노드 | 가능 | 불가 |
| 티어 | 하나의 오픈 제품군 | Plus (품질) / Flash (~300 ms) |
| 언어 지원 | 약 10개 언어 | 16개 언어 + 중국어 방언 20개 지역 |
| 아레나 Quality Elo | 약 929 (Qwen3 TTS Flash) | 1,237 (Plus, 1위) |
| 적합한 용도 | 로컬 제어, 데이터 레지던시, 실험 | 최고 품질, 방언 지원, 대규모 프로덕션 |
호스팅 제어권이나 추가 사용량 비용이 없는 운영이 가장 중요하다면 오픈 웨이트 제품군이 맞습니다. 반대로 품질, 폭넓은 방언 지원, 자체 GPU 운영 부담을 줄이는 일이 더 중요하다면 호스팅형 3.0 티어를 선택할 만합니다.
1위를 만든 평가는 무엇인가
Artificial Analysis 아레나는 독립 제3자가 운영하는 블라인드 청취 선호도 평가입니다. 청취자는 어느 모델이 생성했는지 모른 채 음성 클립을 비교하고, Elo 점수는 각 모델이 비교에서 이긴 빈도를 반영합니다.
2026년 7월 20일 기준 상위권은 다음과 같습니다.
| 순위 | 모델 | Quality Elo | API 가격 / 100만 자 |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
Alibaba가 제시한 자체 지표도 독립 평가와 비슷한 방향을 가리킵니다. 다국어 CV3-Eval 벤치마크에서 Plus 티어의 평균 단어·문자 오류율은 3.96, Flash는 3.87로 보고됐습니다. 생성된 음성을 다시 받아쓰기로 변환했을 때 원문과 거의 비슷한 정확도를 보인다는 뜻입니다. 음성 복제본이 원본 참조 음성과 얼마나 유사한지 측정하는 화자 유사도는, 테스트한 16개 언어 전체에서 Plus 기준 82.75로 보고됐습니다. 이 두 수치는 Alibaba 자체 발표이고, 앞서 언급한 Elo는 독립 평가 수치입니다. 단일 벤치마크만으로 판단하기보다 실제 사용할 오디오와 스크립트로 직접 테스트하는 것이 좋습니다.
실사용에서 눈에 띄는 강점
아레나 순위의 배경에는 프로덕션 환경에서 중요한 네 가지 기능이 있습니다. 세부 내용은 Qwen-Audio-3.0-TTS 공식 기술 페이지에 문서화돼 있습니다.
자연어 지시 기반 제어. "불안한 심야 라디오 진행자처럼 읽고, 끝부분은 더 천천히"처럼 일반 문장으로 음성을 조정할 수 있습니다. 역할, 감정, 말투, 속도, 음색, 억양을 폭넓게 지정할 수 있으며, 기본적인 제어를 위해 별도 마크업 문법을 배울 필요는 없습니다.
세밀한 인라인 태그. 더 정교한 연출이 필요하다면 텍스트 안에 직접 넣는 86개의 인라인 태그를 사용할 수 있습니다. 웃음, 숨소리, 기침, 한숨 같은 비언어적 이벤트도 포함합니다. 단순 낭독과 연기의 차이를 만드는 기능으로, 게임 대사, 내레이션, 영화 더빙에 활용할 수 있는 이유이기도 합니다.
언어 및 방언 지원 폭. 총 16개 언어를 지원하며, 아랍어·인도네시아어·포르투갈어·태국어·베트남어·말레이어·타갈로그어를 포함해 7개 언어가 새로 추가됐습니다. 광둥어와 상하이어부터 쓰촨어, 동북 방언까지 중국어 방언 지역도 20개 지원합니다. 동남아 시장이나 여러 중국어권 시장을 함께 공략하는 팀이라면 이 정도 방언 범위는 다른 제품에서 찾기 쉽지 않습니다.
참조 음성 대응력과 출력 품질. 별도의 노이즈 제거 과정 없이도 잡음이 있거나 잔향이 크고 선명하지 않은 참조 음성에서 음성을 복제합니다. 긴 형식의 내레이션을 위해 한 번에 최대 3분까지 합성할 수 있고, 48kHz 오디오를 출력합니다. 48kHz 콘솔 지원은 7월 24일로 예정돼 있습니다. 짧은 클립을 이어 붙이면 운율과 음색이 흔들리기 쉬운데, 3분 단위의 단일 패스 생성은 이를 줄이는 데 의미가 있습니다.
가격: 1위 품질을 최상위 가격 없이
TTS는 보통 입력 텍스트의 문자 수를 기준으로 과금하므로, 비용은 내레이션 분량에 비례해 늘어납니다.
100만 자당 $27.6인 Qwen-Audio-3.0-TTS-Plus는 자신이 앞선 두 기존 프리미엄 모델보다 훨씬 저렴합니다. ElevenLabs Eleven v3와 MiniMax Speech 2.8 HD는 모두 100만 자당 $100으로 책정돼 있어 약 3.6배 비쌉니다. 예를 들어 10만 자 분량의 오디오북, 대략 짧은 소설 한 권 분량을 생성한다면 Plus에서는 약 $2.76, 두 모델에서는 약 $10이 듭니다.
다만 Plus가 전체 최저가 옵션은 아닙니다. 품질 순위가 한 단계 낮은 Gemini 3.1 Flash TTS는 100만 자당 $18.3으로 3위이고, Simba 3.2는 $10으로 2위이며 Elo 차이도 크지 않습니다. 따라서 정확한 표현은 이렇습니다. Qwen은 최저가가 아니라, 중간 가격대에 아레나 최고 품질을 제공하는 모델입니다. 사용 사례에서 Elo 몇 점 차이가 중요하지 않다면 더 적게 지불할 수 있습니다. (공개 아레나에는 Plus 가격만 표시되며 Flash의 문자당 요금은 아직 공개되지 않았습니다. 현재 Flash 가격은 콘솔에서 확인해야 합니다.)
Qwen-Audio-3.0-TTS 사용 방법
가장 직접적인 경로는 Alibaba Cloud Model Studio (Bailian)입니다. 요청 형식과 SDK는 Model Studio 문서에서 확인할 수 있습니다. API 키를 발급한 뒤 모델 마켓 엔드포인트를 통해 qwen-audio-3.0-tts-plus 또는 qwen-audio-3.0-tts-flash를 호출하면 됩니다. 처음에는 Flash로 지연 시간이 요구사항에 맞는지 확인한 뒤, 같은 스크립트를 Plus에서도 실행해 비교하는 방식이 합리적입니다. 실시간 상호작용인지, 청취자가 처음부터 끝까지 듣는 내레이션인지에 따라 적합한 티어가 달라집니다.
여러 공급사를 호환 가능한 애그리게이터인 AIReiter를 통해 운영하며 청구를 한곳에 모으고 있다면, Alibaba 계정을 별도로 만들지 않고 해당 경로로 추가할 수도 있습니다. 이 모델만 필요하다면 직접 연결하는 편이 가장 간단합니다.
일회성 내레이션이 아닌 실시간 대화가 필요하다면 TTS는 전체 구성의 한 층일 뿐입니다. 함께 사용할 수 있는 omni Realtime API와 스트리밍 ASR은 Qwen Audio 3 Realtime 가이드에서 다룹니다.
어떤 티어를 골라야 할까
- Plus를 선택할 경우 — 중국어, 방언 또는 다국어 내레이션·오디오북·더빙을 생성하며, 비용 대비 가장 자연스러운 음질을 원할 때 적합합니다.
- Flash를 선택할 경우 — 마지막 몇 Elo 점보다 약 300ms의 첫 패킷 지연 시간이 중요한 실시간 음성 에이전트를 만들 때 적합합니다.
- Gemini 3.1 Flash TTS 또는 Simba 3.2를 검토할 경우 — 비용이 최우선이고, 최상위권에 가까운 품질이면 충분할 때입니다. 두 모델 모두 Plus보다 저렴합니다.
- ElevenLabs 또는 Cartesia를 유지할 경우 — 성숙한 SDK, 더 큰 기본 음성 라이브러리, 영어 중심의 도구 및 생태계가 필요하다면 아레나 순위와 별개로 이들이 여전히 강점이 있습니다.
여기서 비교한 모델 가운데 아레나 1위, 중국어 방언 지역 20개, 100만 자당 $27.6이라는 조합을 함께 제공하는 것은 Plus뿐입니다. 이 조합이 사용 사례와 맞는다면 순위만 믿고 결정하기보다, 장기 도입 전에 실제 스크립트로 직접 돌려볼 가치가 충분합니다.
FAQ
Qwen-Audio-3.0-TTS는 무료인가요?
아니요. 호스팅형 Plus와 Flash 티어는 유료이며 Alibaba Cloud Model Studio에서 문자 수 기준으로 과금됩니다. Plus는 100만 자당 $27.6입니다. Alibaba Cloud는 시기에 따라 무료 체험 쿼터를 제공해 왔으므로, 현재 거주 지역에 적용되는 혜택은 콘솔에서 확인하세요. 오픈 웨이트 Qwen3-TTS는 자체 호스팅 시 무료로 사용할 수 있습니다.
Qwen-Audio-3.0-TTS는 오픈 소스인가요? 다운로드할 수 있나요?
호스팅형 Qwen-Audio-3.0-TTS-Plus/Flash 티어는 웨이트 형태로 배포되지 않습니다. 오픈 소스 모델은 이전 세대인 Qwen3-TTS 제품군으로, 로컬 사용과 음성 복제, ComfyUI 워크플로를 위해 GitHub 및 Hugging Face에서 이용할 수 있습니다. 서로 관련은 있지만 별도의 릴리스입니다.
음성 복제를 지원하나요?
네. 참조 오디오에서 대상 음성을 복제하며, 참조 음성에 잡음이나 잔향이 있어도 잘 작동하도록 특별히 조정됐습니다. 별도의 정리 단계는 필요하지 않습니다. Plus 티어의 화자 유사도는 16개 언어 전체에서 평균 82.75로 보고됐습니다.
Qwen-Audio-3.0-TTS와 Qwen3-TTS-Flash의 차이는 무엇인가요?
Qwen3-TTS-Flash는 이전 오픈 웨이트 세대에 속하며 아레나에서 Elo 약 929점으로 훨씬 낮은 순위에 있습니다. Qwen-Audio-3.0-TTS는 새 호스팅형 세대입니다. Flash 티어는 낮은 지연 시간을 목표로 하고, Plus 티어는 Elo 1,237점으로 품질 순위 1위에 올랐습니다.
데모나 ComfyUI 지원이 있나요?
오픈 웨이트 Qwen3-TTS에는 공개 Hugging Face 데모와 커뮤니티 ComfyUI 노드가 있습니다. 호스팅형 Qwen-Audio-3.0-TTS 티어는 별도 데모 페이지가 아니라 Alibaba Cloud Model Studio 콘솔을 통해 이용합니다.