В июле 2026 года Qwen-Audio-3.0-TTS-Plus от Alibaba занял первое место на Artificial Analysis Text-to-Speech arena с Quality Elo 1,237, опередив Gemini 3.1 Flash TTS от Google, MiniMax Speech 2.8 HD и Eleven v3 от ElevenLabs. Его стоимость также составляет $27.6 за миллион символов, что примерно в три раза ниже, чем у ElevenLabs и MiniMax для тех уровней, которые он превосходит. Это не самая дешёвая модель в списке, но ни одна другая модель не сочетает качество №1 с такой ценой. (Показатели приведены по состоянию на 20 июля 2026 года; поставщики часто меняют рейтинг и цену, поэтому перед планированием обязательно проверьте оба параметра.)
Ниже приведено, что это за модель, как она заслужила этот ранг, сколько она стоит и когда она является — или не является — правильным выбором.
Сначала не путайте это с Qwen3-TTS
При поиске "Qwen audio 3.0 TTS" большинство результатов указывают на Qwen3-TTS — открытую speech-семью, которую Alibaba выпустила ранее и опубликовала на GitHub и в виде демо на Hugging Face. Именно эту модель люди запускают локально, подключают к ComfyUI и хвалят на Reddit за клонирование голоса. Это другой продукт, не тот, что описан в этом руководстве.
Qwen-Audio-3.0-TTS — это более новая, размещённая генерация, предоставляемая через Alibaba Cloud Model Studio (Bailian), а не в виде загружаемых весов. Она поставляется в двух уровнях:
- Plus — уровень с приоритетом качества (тот, который занимает 1-е место в рейтинге), предназначенный для аудиокниг, озвучивания и дубляжа, где естественность важнее миллисекунд.
- Flash — уровень с приоритетом минимальной задержки, с задержкой до первого пакета около 300 мс, созданный для взаимодействия в реальном времени, такого как голосовые агенты и живые ассистенты.
Поколенческий разрыв на одной и той же таблице лидеров очевиден: более старый Qwen3 TTS Flash имеет Elo 929 (ранг ~76), тогда как новый уровень Plus лидирует с 1,237. Та же линейка бренда, но совершенно иной класс модели.
Они также выполняют разные задачи. Если вы выбираете между ними, вот в чем разница:
| Qwen3-TTS (open-weight) | Qwen-Audio-3.0-TTS (hosted) | |
|---|---|---|
| Как получить | Скачать веса (GitHub / Hugging Face) | API через Alibaba Cloud Model Studio |
| Самостоятельный хостинг / запуск локально | Да | Нет — только в hosted-режиме |
| ComfyUI & community nodes | Да | Нет |
| Тиры | Единое open-семейство | Plus (качество) / Flash (~300 ms) |
| Покрытие языков | ~10 языков | 16 языков + 20 китайских диалектов |
| Arena Quality Elo | ~929 (Qwen3 TTS Flash) | 1,237 (Plus, #1) |
| Лучше всего подходит для | Локальный контроль, хранение данных в регионе, эксперименты | Высочайшее качество, диалекты, production at scale |
Выбирайте линейку open-weight, когда важнее всего контроль при размещении или нулевая предельная стоимость; выбирайте размещённые уровни 3.0, когда важнее качество, широта диалектов или отсутствие необходимости запускать собственные GPU.
Бенчмарк, который заслужил этот ранг
Арена Artificial Analysis — это вслепую проводимый независимой третьей стороной рейтинг, основанный на предпочтениях людей: слушатели сравнивают клипы, не зная, какая модель их создала, а показатель Elo отражает, как часто побеждает каждая из них.
Вот верхняя часть арены по состоянию на 20 июля 2026 года:
| Ранг | Модель | Качество Elo | Цена API / 1M символов |
|---|---|---|---|
| 1 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1,237 | $27.6 |
| 2 | Simba 3.2 (SpeechifyAI) | 1,232 | $10.0 |
| 3 | Gemini 3.1 Flash TTS (Google) | 1,211 | $18.3 |
| 4 | Sonic 3.5 (Cartesia) | 1,211 | $49.0 |
| 8 | MiniMax Speech 2.8 HD | 1,180 | $100.0 |
| 11 | ElevenLabs Eleven v3 | 1,173 | $100.0 |
Собственные опубликованные Alibaba метрики указывают на то же самое, что и независимый рейтинг. В многоязычном бенчмарке CV3-Eval поставщик сообщает, что тариф Plus в среднем показывает уровень ошибки по словам/символам 3.96, а тариф Flash — 3.87, что означает: синтезированная речь при обратной транскрипции почти так же точна, как исходный текст. Похожесть голоса — показатель того, насколько точно клонированный голос соответствует эталону, — для Plus по всем 16 протестированным языкам составляет 82.75. Эти два показателя — собственные данные Alibaba; показатель Elo выше — нет. Любой отдельный бенчмарк следует рассматривать лишь как отправную точку и проверять на собственном аудио.
Что он делает хорошо
Рейтинг основан на четырёх возможностях, которые важны в production, и описан на официальной технической странице Qwen-Audio-3.0-TTS.
Свободное управление инструкциями. Вы направляете голос с помощью обычного языка — «прочитай это как тревожный ночной радиоведущий, ближе к концу медленнее» — охватывая роль, эмоцию, стиль речи, темп, тембр и акцент. Для общих настроек не нужно изучать отдельный язык разметки.
Детализированные встроенные теги. Для точного контроля модель считывает 86 встроенных тегов, размещённых непосредственно в тексте, включая невербальные события, такие как смех, дыхание, кашель и вздохи. В этом и заключается разница между ровным чтением и исполнением, и именно это делает модель пригодной для игрового диалога, озвучивания повествования и дубляжа фильмов.
Широта охвата языков и диалектов. Он охватывает 16 языков — семь из них были добавлены недавно, включая арабский, индонезийский, португальский, тайский, вьетнамский, малайский и тагальский, — а также 20 региональных китайских диалектов, от кантонского и шанхайского до сычуаньского и северо-восточного. Для команд, работающих на рынках Юго-Восточной Азии или на рынках с китайскоязычной аудиторией, такой охват диалектов трудно превзойти где-либо ещё.
Надежность и качество вывода. Он клонирует голоса из шумного, реверберирующего или нечеткого эталонного аудио без отдельного этапа подавления шума, синтезирует до трех минут за один проход для длинных повествовательных материалов и выдает аудио 48 кГц (развертывание в консоли для 48 кГц запланировано на 24 июля). Однопроходная генерация продолжительностью три минуты важна, потому что при склейке более коротких фрагментов обычно происходит дрейф просодии и тембра.
Цены: высшее качество без заоблачного счета
Преобразование текста в речь тарифицируется за каждый символ входного текста, поэтому стоимость напрямую зависит от того, сколько текста вы озвучиваете.
При $27.6 за миллион символов Qwen-Audio-3.0-TTS-Plus стоит лишь часть от двух прежних премиальных решений, которые он превосходит: ElevenLabs Eleven v3 и MiniMax Speech 2.8 HD оба указаны по $100 за миллион символов, то есть примерно в 3.6 раза дороже. В практическом выражении аудиокнига объёмом 100,000 символов (примерно короткий роман) стоит около $2.76 на Plus против примерно $10 на этих двух.
Однако Plus — не самый дешёвый вариант в целом. Две модели, уступающие ему по качеству на ступень, обходят его по цене: Gemini 3.1 Flash TTS — $18.3 за миллион символов (3-е место), а Simba 3.2 — $10 (2-е место, почти равные по Elo). Поэтому корректная формулировка более узкая: Qwen предлагает качество высшего уровня по цене среднего сегмента, а не самую низкую цену на рынке. Если для вашего сценария несколько очков Elo не имеют значения, вы можете заплатить меньше. (В публичной арене указаны цены Plus; помесячная ставка Flash за символы там пока не опубликована, поэтому проверьте консоль, чтобы увидеть актуальное число для Flash.)
Как использовать Qwen-Audio-3.0-TTS
Прямой путь — это Alibaba Cloud Model Studio (Bailian), а форматы запросов и SDK доступны в документации Model Studio: создайте API key, затем вызывайте модель qwen-audio-3.0-tts-plus или qwen-audio-3.0-tts-flash через endpoint model-market. Разумная отправная точка — сделать прототип на Flash, чтобы понять, подходит ли её задержка, а затем прогнать те же скрипты через Plus и сравнить — правильный тариф зависит от того, нужен ли вам живой интерактивный режим или озвучивание, которое слушатель воспринимает от начала до конца.
Команды, уже направляющие несколько провайдеров через совместимый агрегатор, такой как AIReiter, чтобы вести биллинг в одном месте, могут добавить его там вместо открытия отдельного аккаунта Alibaba; прямое подключение — самый простой вариант, если это единственная модель, которая вам нужна.
Если вам нужен разговор в реальном времени, а не однократное озвучивание, модель TTS — лишь один из уровней; omni Realtime API и streaming ASR, которые работают в паре с ней, описаны в руководстве по Qwen Audio 3 Realtime.
Стоит ли его использовать?
- Выберите Plus, если вы создаёте китайскую, диалектную или мультиязычную озвучку, аудиокниги или дубляж и хотите максимальную естественность за свои деньги.
- Выберите Flash, если вы создаёте голосового агента в реальном времени, где первый пакет примерно за ~300 мс важнее последних нескольких очков Elo в качестве.
- Обратите внимание на Gemini 3.1 Flash TTS или Simba 3.2, если решающим фактором является стоимость, а качество почти на верхнем уровне достаточно хорошее — оба варианта дешевле, чем Plus.
- Оставайтесь с ElevenLabs или Cartesia, если вы зависите от их зрелых SDK, более крупных готовых библиотек голосов или инструментов и экосистемы с приоритетом на английский язык, где они по-прежнему лидируют независимо от позиции в рейтинге.
Среди моделей, сравниваемых здесь, сочетание рейтинга №1 на arena, 20 регионов китайских диалектов и цены $27.6/M — это то, что предлагает только Plus, — поэтому, если этот набор подходит под ваш сценарий использования, стоит прогнать через него собственные скрипты перед принятием решения, а не полагаться на рейтинг на веру.
Часто задаваемые вопросы
Qwen-Audio-3.0-TTS бесплатен?
Нет — размещённые уровни Plus и Flash являются платными и тарифицируются по символам через Alibaba Cloud Model Studio: для Plus это $27.6 за миллион символов. Alibaba Cloud периодически предлагала бесплатные пробные квоты, поэтому проверьте консоль на наличие текущего предложения в вашем регионе. Модель с открытыми весами Qwen3-TTS можно бесплатно развернуть у себя.
Qwen-Audio-3.0-TTS — это открытый исходный код? Могу ли я его скачать?
Хостинговые уровни Qwen-Audio-3.0-TTS-Plus/Flash не распространяются в виде весов. Открытая модель — это более раннее семейство Qwen3-TTS, доступное на GitHub и Hugging Face для локального использования, клонирования и рабочих процессов ComfyUI. Они связаны между собой, но представляют собой отдельные релизы.
Поддерживает ли он клонирование голоса?
Да. Он клонирует голос целевого говорящего по образцу аудио и специально настроен так, чтобы сохранять качество, когда этот образец содержит шум или реверберацию — отдельный этап очистки не нужен. Средняя схожесть голоса составляет 82,75 в тарифе Plus на 16 языках.
Qwen-Audio-3.0-TTS vs Qwen3-TTS-Flash — в чем разница?
Qwen3-TTS-Flash является частью более раннего поколения с открытыми весами и занимает значительно более низкое место в рейтинге arena (Elo ~929). Qwen-Audio-3.0-TTS — это новое размещаемое поколение; его уровень Flash ориентирован на низкую задержку, а уровень Plus возглавляет рейтинг качества с Elo 1,237.
Есть ли демо-версия или поддержка ComfyUI?
Открытая модель Qwen3-TTS имеет публичную демо-версию на Hugging Face и узлы сообщества ComfyUI. К размещённым уровням Qwen-Audio-3.0-TTS можно получить доступ через консоль Alibaba Cloud Model Studio, а не через отдельную страницу демо.
