AIREITER
ДОКИ APIЦЕНЫ
ШАБЛОНЫ
  • AIReiter
  • Блог
  • Qwen-Audio-3.0-TTS: TTS-модель, возглавившая Arena

Qwen-Audio-3.0-TTS: TTS-модель, возглавившая Arena

Последнее обновление: 2026-07-22 07:46:14

В июле 2026 года Qwen-Audio-3.0-TTS-Plus от Alibaba вышла на первое место в Text-to-Speech Arena от Artificial Analysis. Модель получила Quality Elo 1 237, опередив Gemini 3.1 Flash TTS от Google, MiniMax Speech 2.8 HD и Eleven v3 от ElevenLabs. При этом её цена составляет $27.6 за миллион символов — примерно треть стоимости тарифов ElevenLabs и MiniMax, которые она обходит в рейтинге. Это не самое дешёвое решение в таблице, но ни одна другая модель не сочетает первое место по качеству с такой ценой. Данные актуальны на 20 июля 2026 года: позиции и тарифы у провайдеров меняются часто, поэтому перед планированием их стоит перепроверить.

Рейтинг Artificial Analysis Text-to-Speech, где Qwen-Audio-3.0-TTS-Plus занимает первое место

Разберёмся, что это за модель, за счёт чего она получила такой результат, сколько стоит и в каких сценариях действительно будет удачным выбором.

Не путайте с Qwen3-TTS

По запросу «Qwen audio 3.0 TTS» поисковики чаще всего выводят Qwen3-TTS — более раннее открытое семейство речевых моделей Alibaba, опубликованное на GitHub и доступное в виде демо на Hugging Face. Именно его запускают локально, подключают к ComfyUI и обсуждают на Reddit в контексте клонирования голосов. Однако речь идёт о другом продукте.

Qwen-Audio-3.0-TTS — новое поколение модели, доступное только как облачный сервис через Alibaba Cloud Model Studio (Bailian), без загрузки весов. В линейке две версии:

  • Plus — вариант с приоритетом качества. Именно он занял первое место в рейтинге; предназначен для аудиокниг, озвучки и дубляжа, где естественность важнее нескольких миллисекунд задержки.
  • Flash — вариант с акцентом на скорость: задержка до первого пакета составляет около 300 мс. Подходит для голосовых агентов, живых ассистентов и других интерактивных сценариев.

Разрыв между поколениями хорошо виден в том же рейтинге: более старый Qwen3 TTS Flash имеет Elo 929 и занимает примерно 76-е место, тогда как новый Plus лидирует с 1 237 Elo. Общее происхождение есть, но класс моделей совершенно разный.

Задачи у них тоже отличаются. Если выбирать между двумя линейками, ориентируйтесь на эту таблицу:

Qwen3-TTS (открытые веса)Qwen-Audio-3.0-TTS (облачный сервис)
Способ полученияСкачать веса с GitHub / Hugging FaceAPI через Alibaba Cloud Model Studio
Самостоятельный хостинг / локальный запускДаНет, только облачный доступ
ComfyUI и community-нодыДаНет
ВерсииЕдиное открытое семействоPlus (качество) / Flash (~300 мс)
Языковая поддержка~10 языков16 языков + 20 китайских диалектов
Quality Elo в Arena~929 (Qwen3 TTS Flash)1 237 (Plus, #1)
Лучше всего подходит дляЛокального контроля, размещения данных, экспериментовМаксимального качества, диалектов и промышленного масштаба

Открытую линейку стоит выбирать, когда критичны полный контроль над хостингом или нулевая предельная стоимость генерации. Облачные версии 3.0 логичнее брать, если важнее качество, широкий охват диалектов или отсутствие необходимости содержать собственные GPU.

За что модель получила первое место

Artificial Analysis Arena — независимый рейтинг на основе слепого пользовательского сравнения. Слушатели сопоставляют аудиофрагменты, не зная, какой моделью они созданы, а Elo показывает, как часто та или иная модель побеждает в таких парах.

Так выглядела верхняя часть рейтинга на 20 июля 2026 года:

МестоМодельQuality EloЦена API / 1 млн символов
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1 237$27.6
2Simba 3.2 (SpeechifyAI)1 232$10.0
3Gemini 3.1 Flash TTS (Google)1 211$18.3
4Sonic 3.5 (Cartesia)1 211$49.0
8MiniMax Speech 2.8 HD1 180$100.0
11ElevenLabs Eleven v31 173$100.0

Собственные метрики Alibaba указывают в том же направлении, хотя это не независимая оценка. В многоязычном бенчмарке CV3-Eval компания сообщает средний уровень ошибок слов/символов 3.96 у Plus и 3.87 у Flash: синтезированная речь почти без потерь распознаётся обратно в исходный текст. Показатель сходства с голосом-образцом, оценивающий точность клонирования, для Plus равен 82.75 по всем 16 протестированным языкам. Эти две цифры приводит Alibaba, тогда как Elo выше получен независимо. Любой единичный бенчмарк стоит воспринимать как отправную точку и проверять модель на собственных аудиоматериалах.

Сильные стороны Qwen-Audio-3.0-TTS

Высокая позиция в рейтинге опирается на четыре возможности, важные для реального использования и описанные на официальной технической странице Qwen-Audio-3.0-TTS.

Обзор возможностей Qwen-Audio-3.0-TTS и результаты CV3-Eval

Управление голосом обычным текстом. Характер подачи можно задавать естественной инструкцией: например, «прочитай это как тревожный ночной радиоведущий, а ближе к концу говори медленнее». Так задаются роль, эмоция, стиль речи, темп, тембр и акцент — без необходимости осваивать отдельный язык разметки для базового управления.

Точная настройка тегами прямо в тексте. Когда общего описания недостаточно, модель понимает 86 inline-тегов, которые вставляются непосредственно в текст. Среди них есть невербальные события: смех, дыхание, кашель и вздохи. Именно такие детали отделяют монотонное чтение от полноценной актёрской подачи и делают модель пригодной для игровых реплик, закадрового текста и кинодубляжа.

Языки и китайские диалекты. Модель поддерживает 16 языков, семь из которых добавлены недавно: арабский, индонезийский, португальский, тайский, вьетнамский, малайский и тагальский. Кроме того, заявлены 20 регионов китайских диалектов — от кантонского и шанхайского до сычуаньского и северо-восточного. Для команд, работающих с рынками Юго-Восточной Азии или китайскоязычной аудиторией, такой охват диалектов сложно найти у конкурентов.

Устойчивость к плохому исходнику и качество вывода. Модель клонирует голос даже по шумной, гулкой или нечёткой референсной записи, не требуя отдельного этапа шумоподавления. За один проход она может синтезировать до трёх минут речи для длинных форматов и выдаёт аудио с частотой 48 кГц; появление 48 кГц в консоли запланировано на 24 июля. Генерация одним проходом важна для длинной озвучки: при склейке коротких фрагментов обычно начинают «плыть» просодия и тембр.

Цена: первое качество без премиального счёта

В TTS-сервисах оплата обычно рассчитывается по количеству символов входного текста, поэтому затраты напрямую зависят от объёма озвучки.

При цене $27.6 за миллион символов Qwen-Audio-3.0-TTS-Plus обходится значительно дешевле двух премиальных моделей, которые она опережает: ElevenLabs Eleven v3 и MiniMax Speech 2.8 HD стоят по $100 за миллион символов, то есть примерно в 3.6 раза дороже. На практике озвучка аудиокниги объёмом 100 000 символов — примерно небольшой роман — будет стоить около $2.76 на Plus против примерно $10 у этих двух сервисов.

Но самым дешёвым вариантом Plus не является. Две модели с немного более низким качеством стоят меньше: Gemini 3.1 Flash TTS — $18.3 за миллион символов и третье место, Simba 3.2 — $10 и второе место, почти вровень по Elo. Корректная формулировка здесь узкая: Qwen предлагает лидирующее качество по цене среднего сегмента, но не минимальную цену в рейтинге. Если несколько пунктов Elo несущественны для вашей задачи, можно сэкономить. В публичной Arena указана цена Plus; посимвольный тариф Flash там пока не опубликован, поэтому актуальную стоимость следует уточнять в консоли.

Как подключить Qwen-Audio-3.0-TTS

Напрямую модель доступна через Alibaba Cloud Model Studio (Bailian). Форматы запросов и SDK описаны в документации Model Studio: создайте API-ключ, затем вызывайте qwen-audio-3.0-tts-plus или qwen-audio-3.0-tts-flash через endpoint маркетплейса моделей. Разумный стартовый подход — сначала протестировать Flash и проверить, устраивает ли вас задержка, затем пропустить те же сценарии через Plus и сравнить результат. Выбор версии определяется тем, что вы создаёте: интерактивный голосовой сервис или озвучку, которую слушают целиком.

Команды, которые уже подключают нескольких провайдеров через совместимый агрегатор вроде AIReiter, чтобы вести биллинг в одном месте, могут добавить модель там, не открывая отдельный аккаунт Alibaba. Если же нужна только эта модель, прямое подключение будет проще.

Для разговорных сценариев в реальном времени одной TTS-модели недостаточно: связанный с ней omni Realtime API и потоковый ASR разобраны в гайде по Qwen Audio 3 Realtime.

Стоит ли использовать модель?

  • Выбирайте Plus, если вам нужна китайская, диалектная или многоязычная озвучка, аудиокниги либо дубляж и требуется максимальная естественность за свои деньги.
  • Выбирайте Flash, если вы создаёте голосового агента реального времени, где первый пакет за ~300 мс важнее последних нескольких пунктов Elo.
  • Присмотритесь к Gemini 3.1 Flash TTS или Simba 3.2, если главным критерием остаётся цена, а почти максимального качества достаточно: обе модели дешевле Plus.
  • Оставайтесь с ElevenLabs или Cartesia, если вы завязаны на их зрелые SDK, более крупные библиотеки готовых голосов либо инструменты и экосистему, ориентированные прежде всего на английский язык. В этих аспектах они по-прежнему впереди, независимо от позиции в Arena.

Среди рассмотренных здесь моделей только Plus объединяет первое место в Arena, 20 регионов китайских диалектов и цену $27.6 за миллион символов. Если этот набор соответствует вашей задаче, имеет смысл прогнать через модель собственные сценарии до окончательного выбора, а не полагаться только на рейтинг.

FAQ

Qwen-Audio-3.0-TTS бесплатна?

Нет. Облачные версии Plus и Flash платные и тарифицируются посимвольно через Alibaba Cloud Model Studio; для Plus цена составляет $27.6 за миллион символов. Alibaba Cloud периодически предлагает бесплатные пробные квоты, поэтому актуальные условия для своего региона лучше проверить в консоли. Открытую Qwen3-TTS можно бесплатно развернуть самостоятельно.

Qwen-Audio-3.0-TTS имеет открытый исходный код? Её можно скачать?

Веса облачных версий Qwen-Audio-3.0-TTS-Plus/Flash не распространяются. Открытой является более ранняя линейка Qwen3-TTS: она доступна на GitHub и Hugging Face для локального использования, клонирования голосов и сценариев с ComfyUI. Это связанные, но отдельные релизы.

Поддерживается ли клонирование голосов?

Да. Модель клонирует целевой голос по референсной записи и специально оптимизирована для работы с шумным или гулким исходником, без отдельной очистки аудио. Средний показатель сходства с голосом для Plus составляет 82.75 по 16 языкам.

Чем Qwen-Audio-3.0-TTS отличается от Qwen3-TTS-Flash?

Qwen3-TTS-Flash относится к более раннему поколению с открытыми весами и находится существенно ниже в Arena — около 929 Elo. Qwen-Audio-3.0-TTS — новое облачное поколение: его Flash ориентирован на низкую задержку, а Plus возглавляет рейтинг качества с Elo 1 237.

Есть ли демо или поддержка ComfyUI?

Для открытой Qwen3-TTS доступно публичное демо на Hugging Face и community-ноды для ComfyUI. Облачные версии Qwen-Audio-3.0-TTS подключаются через консоль Alibaba Cloud Model Studio, а не через отдельную страницу демо.

>_Каталог моделей AIReiter

Быстрый API-доступ к моделям, связанным с этим гайдом

Gemini 3.1 Pro

Chat
GoogleСоздать API Key >

Gemini 3 Pro

Chat
GoogleСоздать API Key >

Claude Fable 5

Chat

Премиальная модель Claude для глубокого рассуждения и сложной объемной работы.

AnthropicСоздать API Key >

Claude Fable 5.1

Chat

Mythos-class model for long-horizon coding, research, and knowledge work.

AnthropicСоздать API Key >

Claude Opus 4.8

Chat

Высокопроизводительная модель Claude для сложных задач, требующих глубоких рассуждений и профессиональной работы.

AnthropicСоздать API Key >

Недавние статьи

Альтернативы Civitai: Hugging Face, Tensor.Art, SeaArt и ComfyUI

2026-09-10

Стоимость Kling API: официальные тарифы и агрегаторы (2026)

2026-09-10

Руководство по OpenRouter Shell Tool и Files API (бета)

2026-09-10

Обзор плагина Runway для Adobe: работа с Premiere Pro и After Effects

2026-09-09
AIREITER

Есть вопросы? Свяжитесь с нами
[email protected]

新速率有限公司NEWRATE LIMITED香港九龍花園街 2-16 號好景商業中心 2304 室Room 2304, Haojing Commercial Center, 2-16 Garden Street, Kowloon, Hong Kong

LLM

GPT-6 AstraGemini 3.8 FlashClaude Fable 5.1GLM-5.3 FlashGemini 3.6 Flash

AI-видео

Gemini Omni 1.1 Flash ExtMiniMax H3Kling 3.0 Motion ControlKling 3.0 TurboKling 3.0

AI-изображения

GPT-Image 2.5Grok Imagine Image 2.0Midjourney V8.1Midjourney V7Z-Image Turbo

Блог

Посмотреть все →

Компания

Политика конфиденциальностиУсловия обслуживанияПолитика возврата

© 2026 AIReiter. Все права защищены.