Qwen-Audio-3.0-TTS: アリーナでトップを獲得したTTSモデル

最終更新日: 2026-07-20 10:08:04

2026年7月、AlibabaのQwen-Audio-3.0-TTS-PlusArtificial Analysis Text-to-Speech arenaでQuality Elo 1,237を記録し、GoogleのGemini 3.1 Flash TTS、MiniMax Speech 2.8 HD、ElevenLabsのEleven v3を上回って首位を獲得しました。また、100万文字あたり27.6ドルという価格で、同モデルより下位のティアに対してElevenLabsとMiniMaxが設定している料金のおよそ3分の1です。ボード上で最安のモデルではありませんが、#1の品質とこの価格を両立しているモデルは他にありません。(数値は2026年7月20日時点のものです。各ベンダーは順位と価格を頻繁に変更するため、計画を立てる前にその両方を必ず確認してください。)

Artificial Analysis Text-to-Speech leaderboard with Qwen-Audio-3.0-TTS-Plus ranked first

以下では、そのモデルが何であるか、その順位を獲得した理由、費用、そしてどのような場合に適しているのか、あるいは適していないのかを説明します。

まず、Qwen3-TTSと混同しないでください

「Qwen audio 3.0 TTS」で検索すると、ほとんどの結果はQwen3-TTSを指します。これは、Alibabaが以前に公開したオープンウェイトの音声ファミリーで、GitHubHugging Faceのデモで公開されています。これは、人々がローカルで実行し、ComfyUIに組み込み、音声クローンでReddit上で絶賛しているモデルです。これは、このガイドで扱うものとは別の製品です。

Qwen-Audio-3.0-TTS は、ダウンロード可能な重みとしてではなく、Alibaba Cloud Model Studio (Bailian) を通じて提供される、より新しいホスト型の生成です。2つの階層で提供されています:

  • Plus — 品質最優先のプラン(#1ランクを獲得するもの)で、自然さがミリ秒よりも重要なオーディオブック、ナレーション、吹き替え向けです。
  • Flash — レイテンシ最優先のプランで、最初のパケット遅延は約300 ms。音声エージェントやライブアシスタントのようなリアルタイム対話向けに設計されています。

同じリーダーボード上で、世代間の差は歴然です。古いQwen3 TTS FlashはElo 929(約76位)に位置していますが、新しいPlusティアは1,237で首位です。同じブランドの系譜でも、モデルのクラスは異なります。

この2つは役割も異なります。どちらを選ぶか迷っているなら、違いは次のとおりです:

Qwen3-TTS (open-weight)Qwen-Audio-3.0-TTS (hosted)
入手方法重みをダウンロード(GitHub / Hugging Face)Alibaba Cloud Model Studio 経由の API
セルフホスト / ローカル実行はいいいえ — ホスト型のみ
ComfyUI & community nodesはいいいえ
Tier単一のオープンファミリーPlus(高品質) / Flash(約300 ms)
対応言語約10言語16言語 + 20の中国語方言
Arena Quality Elo約929(Qwen3 TTS Flash)1,237(Plus、#1)
最適な用途ローカル制御、データ所在、試行錯誤最高品質、方言、規模での本番運用

ホスティングの制御や限界費用ゼロが最も重要な場合は、open-weight系を選んでください。品質、方言の幅広さ、または自前のGPUを運用しないことのほうが重要な場合は、ホスト型の3.0ティアを選んでください。

そのランクを獲得したベンチマーク

Artificial Analysisのアリーナは、独立した第三者によって運営されるブラインドの人間の好みに基づくランキングです。リスナーは、どのモデルが生成したかを知らずにクリップを比較し、Eloスコアは各モデルがどのくらいの頻度で勝つかを反映します。

2026年7月20日時点のアリーナ上位は次のとおりです:

順位モデル品質 EloAPI価格 / 100万文字
1Qwen-Audio-3.0-TTS-Plus (Alibaba)1,237$27.6
2Simba 3.2 (SpeechifyAI)1,232$10.0
3Gemini 3.1 Flash TTS (Google)1,211$18.3
4Sonic 3.5 (Cartesia)1,211$49.0
8MiniMax Speech 2.8 HD1,180$100.0
11ElevenLabs Eleven v31,173$100.0

Alibaba自身の報告指標も、独立したランキングと同じ方向を示しています。多言語CV3-Evalベンチマークでは、ベンダーはPlusティアの平均語/文字エラー率を3.96、Flashティアを3.87と報告しており、合成音声が元のテキストにほぼ同じ精度で書き起こされることを意味します。クローン音声が参照音声とどれだけ近いかを示す指標である話者類似度は、テストした16言語全体でPlusが82.75と報告されています。これら2つの数値はAlibaba自身のものですが、上記のEloはそうではありません。単一のベンチマークは出発点として扱い、ご自身の音声でテストしてください。

得意なこと

この順位は、実運用で重要となる4つの機能に基づいており、公式の Qwen-Audio-3.0-TTS 技術ページに記載されています。

Qwen-Audio-3.0-TTS capability overview and CV3-Eval results

自由形式の指示による制御。 平易な言葉で音声を操れます — 「これを深夜ラジオの不安げなDJのように、終盤に向かって少しゆっくり読んで」 — という具合に、役割、感情、話し方、速度、音色、アクセントまで指定できます。大まかな方向性のために別のマークアップ言語を学ぶ必要はありません。

きめ細かなインラインタグ。 精密な制御のために、モデルは本文中に直接配置された86個のインラインタグを読み取り、笑い、呼吸、咳、ため息といった非言語的な出来事も含まれます。これが、平坦な読み上げとパフォーマンスの違いであり、ゲームのセリフ、ナレーション、映画の吹き替えにこのモデルを使えるようにしているものです。

言語と方言の幅。 16言語をカバーしており、そのうち7言語は新たに追加されたもので、Arabic、Indonesian、Portuguese、Thai、Vietnamese、Malay、Tagalog を含みます。さらに、Cantonese や Shanghainese から Sichuanese、Northeastern まで、20の中国語方言地域にも対応しています。東南アジア向け、または中国語圏全体に展開するチームにとって、この方言カバレッジに匹敵するものは他にほとんどありません。

堅牢性と出力品質。 ノイズが多い、残響のある、または不明瞭な参照音声から、別途のノイズ除去工程なしで声をクローンし、長文のナレーションでは一度の処理で最大3分まで合成し、48 kHzの音声を出力します(48 kHzのコンソールへの展開は7月24日予定です)。3分の単一パス生成が重要なのは、短いクリップをつなぎ合わせると、通常、韻律と音色が変化してしまうためです。

価格:最高級の請求なしで最高品質

テキスト読み上げは入力テキストの文字数ごとに課金されるため、費用は読み上げる量に直接比例します。

100万文字あたり$27.6のQwen-Audio-3.0-TTS-Plusは、上回っている2つの従来のプレミアム製品、ElevenLabs Eleven v3とMiniMax Speech 2.8 HDのごく一部の価格です。両者はいずれも100万文字あたり$100で、約3.6倍高くなっています。実際の利用では、10万文字のオーディオブック(おおよそ短編小説1冊)にかかる費用は、Plusでは約$2.76、これら2つでは約$10です。

ただし、Plus が全体として最安というわけではありません。品質面で一段下の2つのモデルがそれを下回っています。Gemini 3.1 Flash TTS は100万文字あたり18.3ドル(順位3位)、Simba 3.2 は10ドル(順位2位、Elo ではほぼ同点)です。したがって、正確な言い方は限定的です。つまり、Qwen は中位の価格で最高ランクの品質を提供しており、最安値ではないということです。あなたのユースケースで Elo の数ポイントが重要でないなら、より安く使えます。(公開アリーナには Plus の価格が掲載されています。Flash の文字単価はまだそこで公開されていないため、ライブの Flash の数値はコンソールで確認してください。)

Qwen-Audio-3.0-TTSの使い方

直接のルートは Alibaba Cloud Model Studio (Bailian) で、リクエスト形式とSDKは Model Studio documentation にあります。API key を用意し、その後 model-market エンドポイント経由で qwen-audio-3.0-tts-plus または qwen-audio-3.0-tts-flash モデルを呼び出します。妥当な出発点としては、まず Flash でプロトタイプを作成してレイテンシが要件に合うかを確認し、同じスクリプトを Plus で実行して比較することです。適切なプランは、用途がライブ対話なのか、それともリスナーが最初から最後まで聞くナレーションなのかによって決まります。

すでにAIReiterのような互換性のあるアグリゲーターを通じて複数のプロバイダーを連携させ、請求を一元化しているチームは、別途Alibabaアカウントを開設する代わりにそこへ追加できます。必要なモデルがこれだけなら、直接利用するのが最も簡単です。

一度きりのナレーションではなく、リアルタイムの会話が必要な場合、TTSモデルはそのうちの1層にすぎません。これと組み合わさる omni Realtime API とストリーミング ASR については、Qwen Audio 3 Realtime ガイドで解説しています。

使うべきですか?

  • Plus を選ぶなら、中国語、方言、または多言語のナレーション、オーディオブック、吹き替えを生成し、1ドルあたりで最高の自然さを求める場合です。
  • Flash を選ぶなら、約300 msの最初のパケットが品質の最後の数 Elo ポイントより重要な、リアルタイム音声エージェントを構築している場合です。
  • Gemini 3.1 Flash TTS または Simba 3.2 を検討するなら、コストが決め手で、ほぼ最上位の品質で十分な場合です。どちらも Plus より安価です。
  • ElevenLabs または Cartesia のままにするなら、成熟した SDK、より大きなプリビルト音声ライブラリ、または English-first のツールとエコシステムに依存しており、アリーナでの順位に関係なく依然としてそれらが優位な場合です。

ここで比較したモデルの中で、#1のアリーナ順位、20の中国語方言地域、そして$27.6/Mの価格を兼ね備えているのはPlusだけです。そのため、この組み合わせがあなたのユースケースに合うのであれば、順位を鵜呑みにして決めるのではなく、コミットする前に自分のスクリプトを実際に通してみる価値があります。

よくある質問

Qwen-Audio-3.0-TTS は無料ですか?

いいえ — ホスト型の Plus と Flash の各プランは有料で、Alibaba Cloud Model Studio を通じて文字単位で課金されます。Plus は100万文字あたり27.6ドルです。Alibaba Cloud は定期的に無料トライアル枠を提供しているため、お住まいの地域で現在の提供内容はコンソールで確認してください。オープンウェイトの Qwen3-TTS は、自己ホストであれば無料です。

Qwen-Audio-3.0-TTS はオープンソースですか?ダウンロードできますか?

ホスト型の Qwen-Audio-3.0-TTS-Plus/Flash tier は重みとして配布されていません。オープンソースのモデルは、GitHub と Hugging Face でローカル利用、クローン、ComfyUI ワークフロー向けに提供されている、以前の Qwen3-TTS ファミリーです。これらは関連していますが、別々のリリースです。

ボイスクローンに対応していますか?

はい。参照音声から対象の声をクローンし、その参照音声がノイズが多い、または残響がある場合でも性能を保てるように特別に調整されています。別途クリーンアップ処理は不要です。話者の類似度は、Plusプランの16言語全体で平均82.75です。

Qwen-Audio-3.0-TTS と Qwen3-TTS-Flash — 何が違うのですか?

Qwen3-TTS-Flash は以前のオープンウェイト世代の一部で、アリーナではかなり下位に位置しています(Elo 約929)。Qwen-Audio-3.0-TTS は新しいホスト型世代で、Flash ティアは低遅延を、Plus ティアは品質ランキングの最上位を目指しており、Elo 1,237 を記録しています。

デモやComfyUIのサポートはありますか?

オープンウェイトの Qwen3-TTS には、公開された Hugging Face デモとコミュニティの ComfyUI ノードがあります。ホスト型の Qwen-Audio-3.0-TTS の各プランには、単独のデモページではなく Alibaba Cloud Model Studio コンソールを通じてアクセスします。