AIREITER

Kokoro 82M TTS:本機 CPU 測試、語音與成本

最近更新: 2026-09-28 01:31:32

如果你想製作自然的旁白,又不希望每句文字都送往付費 API,Kokoro 82M TTS 是目前最值得優先試用的開放模型之一。不過,「82M」並不代表它能全面取代 ElevenLabs:Kokoro 最適合預設語音、乾淨的旁白,以及在本機執行的批次工作;至於聲音複製、戲劇化表現控制和託管服務的穩定性,則是其他方案更有優勢。

先講結論:你該不該用

Kokoro-82M 是一款採開放權重的文字轉語音模型,包含 8,200 萬個參數。目前 Hugging Face 模型卡將 v1.0 列為 2025 年 1 月 27 日發布,支援 8 種語言與 54 種語音,模型權重採 Apache 2.0 授權:官方模型卡。官方推論函式庫是 hexgrad/kokoro。

如果你需要私有或離線旁白、能接受預設語音,而且工作量大到 API 費用開始變得明顯,Kokoro 值得考慮。若你需要聲音複製、完整的託管工作室,或具表現力的商業級輸出,選 ElevenLabs 會更合理。若多語言支援與聲音複製比小巧的模型體積更重要,則可以看 Qwen3-TTS。

本機安裝:真正能順利跑起來的路徑

官方範例使用 Python、kokoro、soundfile、PyTorch 和 espeak-ng;輸出的音訊取樣率為 24 kHz。在 Linux 上,基本安裝指令如下:

pip install -q "kokoro>=0.9.4" soundfile
sudo apt-get install espeak-ng

最精簡的英文範例:

from kokoro import KPipeline
import soundfile as sf

pipeline = KPipeline(lang_code="a")
text = "Kokoro is a small local text to speech model."

for index, (_, _, audio) in enumerate(
    pipeline(text, voice="af_heart", speed=1)
):
    sf.write(f"kokoro-{index}.wav", audio, 24000)

專案文件列出了美式與英式英文、西班牙文、法文、印地文、義大利文、日文、巴西葡萄牙文,以及中文的語言代碼。日文和中文需要安裝對應的 Misaki 額外套件。語言代碼必須與所選語音相符。

Windows 不是一行指令就能完成安裝:專案 README 會引導使用者下載 espeak-ng 的 MSI 版本。Apple Silicon 使用者則可以透過 PYTORCH_ENABLE_MPS_FALLBACK=1 嘗試使用 PyTorch MPS。第一次執行失敗時,這些環境細節往往比模型參數量更關鍵。

CPU、GPU 與即時速度:目前能確認到什麼

Kokoro 支援 CPU 推論,但官方模型卡與官方函式庫都沒有提供適用於所有環境的統一即時倍率。實際速度會受到執行環境、處理器、語言、文字切分方式,以及第一次執行是否包含模型載入等因素影響。

社群測試也說明了為什麼不能隨便下廣泛結論。在一份詳細比較中,@analogalok 回報,使用 GPU 生成 21 秒音訊約需 0.7 秒,而該環境大約使用 0.9 GB VRAM。這能證明低記憶體 GPU 路徑可行,但不能當成所有筆電都能達到的保證。

「我可以很輕鬆地用 CPU 執行它,而且產出的音訊聽起來非常舒服。」——@rasmus1610,X

在自己的硬體上測試時,建議把以下三個數字分開記錄:

  1. 從程序啟動到第一段音訊產出的時間。
  2. 模型與語音載入完成、進入熱機狀態後的生成時間。
  3. 音訊長度除以熱機狀態下的生成時間,也就是實際即時倍率。

對批次旁白工作而言,第三個數字會直接影響處理量。互動式助理則更在意首個音訊片段的延遲與串流行為。不要把 GPU 測試結果當成 CPU 結果,也不要用 10 秒樣本就宣稱這是「生產環境吞吐量」。

語音、語言,以及不能忽略的限制

v1.0 模型卡列出 8 種語言與 54 種語音,相較於只有 1 種語言和 10 種語音的 v0.19,擴充幅度相當大。函式庫文件列出的語言代碼如下:

代碼語言
a美式英文
b英式英文
e西班牙文
f法文
h印地文
i義大利文
j日文
p巴西葡萄牙文
z中文

Kokoro 使用預設語音,並不是可以根據參考音訊進行聲音複製的系統。它也依賴 Misaki 字素轉音素堆疊,以及 espeak-ng 的備援路徑。正式匯出長篇內容前,建議先測試人名、縮寫、數字和混合語言文字。

Apache 2.0 模型授權對商業部署相當有吸引力,但「模型採 Apache 2.0 授權」不代表所有語音樣本、資料集或第三方依賴都自動適用相同條件。將模型卡、語音檔案和依賴套件授權一併列入發布檢查清單。

Kokoro、ElevenLabs 與 Qwen3-TTS 怎麼選

只有在三個系統使用相同文字、語音需求、文字正規化方式、輸出音量與評測人員組成時,盲聽比較才有意義。本文不宣稱誰在受控盲聽測試中勝出;官方 Kokoro 資料也沒有發布這類測試。更可靠的比較方式,是看它們在工作流程上的取捨:

考量因素Kokoro-82MElevenLabsQwen3-TTS
部署方式本機/開放權重託管 API 與工作室本機/開放模型系列
模型授權/來源Apache 2.0 權重供應商條款官方模型卡列出 Apache 2.0
預設語音有大型託管語音庫CustomVoice 與其他變體
聲音複製無部分方案/功能支援Base 變體支援參考音訊複製
語言v1.0 列出 8 種依模型而定;官方 API 價格會隨模型變動列出 10 種語言
最適合私有批次旁白託管、具表現力的正式製作多語言或聲音複製實驗
主要成本硬體或託管推論按字元/點數計費硬體或託管服務

ElevenLabs 官方 API 定價頁目前列出,Flash/Turbo 約為每 1,000 個字元 $0.05,v2 Multilingual 與 v3 則為每 1,000 個字元 $0.10:API 定價。Qwen3-TTS 官方模型卡列出中文、英文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文,並提供針對聲音複製的變體:Qwen3-TTS 模型卡。

實際結論不是「Kokoro 聽起來更好」。Kokoro 的優勢在於移除持續性的 API 依賴,並讓文字留在自己的機器上;ElevenLabs 買到的是便利性,Qwen3-TTS 則以更大的本機模型體積,換取更廣的多語言與聲音複製功能。

批次旁白成本:哪些數字站得住腳

本機執行 Kokoro 不會產生按字元計算的模型費用。你的邊際成本主要是電力、儲存空間,以及負責執行推論的機器或雲端執行個體。如果你已經擁有這台機器,新增的軟體成本基本上是零;如果是租用 GPU 或 CPU,則用供應商的每小時費率乘以實際生成所需的時間即可。

作為 API 比較基準,Kokoro 模型卡在 2025 年 4 月記錄了以下託管服務案例:每 100 萬個輸入字元低於 $1,其中 Replicate 為 $0.65、DeepInfra 為 $0.80。這些是有日期的參考數字,不代表目前價格保證。以相同文字量計算,ElevenLabs 官方費率會得到以下結果:

工作量Kokoro 本機模型費用ElevenLabs Flash/TurboElevenLabs v2 Multilingual/v3
100,000 個字元本機 $0*$5$10
1,000,000 個字元本機 $0*$50$100
10,000,000 個字元本機 $0*$500$1,000

\*不包含電力、硬體、託管服務與工程時間。ElevenLabs 數字採用官方每 1,000 個字元 $0.05/$0.10 的費率,未計入方案折扣、點數、稅金與超額使用規則。這張表是預算估算模型,不是最終帳單保證。

因此,對字幕、文件、無障礙音訊和內部培訓片段等可重複執行的旁白流程來說,Kokoro 特別有吸引力。但如果校對發音與拼接片段的人力成本已經超過 API 費用,它的優勢就沒那麼明顯。

常見問題

Kokoro 不用 GPU 也能執行嗎?

可以。Kokoro 支援 CPU 推論,但官方專案沒有承諾統一的即時倍率。請在實際要部署的 CPU 與語言上,測量熱機狀態下的處理速度。

Kokoro 可以複製聲音嗎?

不行。Kokoro 是預設語音系統。如果說話者身分是核心需求,請改用支援聲音複製的模型,例如合適的 Qwen3-TTS 變體。

Kokoro 可以免費商用嗎?

Kokoro-82M 模型卡列出的權重採 Apache 2.0 授權,屬於寬鬆授權。正式發布商業產品前,仍應確認實際使用的語音、依賴套件與散布條款。

Kokoro 支援哪些語言?

v1.0 模型卡列出 8 種語言;官方函式庫文件則列出美式與英式英文,以及西班牙文、法文、印地文、義大利文、日文、巴西葡萄牙文和中文。部分語言可能需要安裝專用套件。

Kokoro 比 ElevenLabs 好嗎?

不是所有面向都更好。Kokoro 更適合本機、私有、使用預設語音的批次旁白;ElevenLabs 則更適合託管基礎設施、聲音複製與具表現力的正式製作流程。

實際該怎麼選

如果你的驗收標準是:「這台機器能不能在隱私不外流的前提下,以所需速度產生乾淨旁白,而且使用可用的其中一種語音?」那就從 Kokoro 開始。測試時不要只念一般句子,還要加入人名、日期、數字、長段落,以及實際需要的語言。

如果測試通過,經濟效益很直接:用機器時間取代持續性的字元費用。如果它在發音、說話者身分或情緒表現上不符合需求,改用 ElevenLabs 或 Qwen3-TTS 並不是品質上的失敗,而是為了取得 Kokoro 刻意不優先支援的能力付費。

如果你也在評估同一類商業方案,請參考ElevenLabs Eleven v3 API 指南。