Eleven v3 已於 2026 年 2 月 2 日結束 alpha,程式在 ElevenLabs API 中呼叫的模型 ID 是 eleven_v3。ElevenLabs 與 fal.ai 的收費都是每 1,000 字元 $0.10,因此不能只看單價來做選擇;真正有差的是計費方式、並行能力與語音存取權限。正式版也修掉了不少實際問題:根據正式發布公告,在涵蓋 27 個類別、8 種語言的基準測試中,結構化文字錯誤率從 15.3% 降至 4.9%。不過整合時仍要先記住兩個硬限制:單次請求最多 5,000 字元,而且模型官方仍明確表示不適合即時使用。
ElevenLabs Eleven v3 API 能做什麼
Eleven v3 API 提供四組功能:建立語音、串流語音,以及針對多人對話音訊的建立對話與串流對話端點。模型支援 70 多種語言,也能在文字中插入音訊標籤來指定情緒與說話方式;正式版推出後,ElevenLabs 自家測試有 72% 的情況更偏好它,而不是 alpha 版本。
如果你打算把結構化文字交給 v3,最好先看基準測試的分類結果:化學式錯誤率從 45.6% 降到 0.6%,電話號碼從 16.9% 降到 0.6%,ISBN 則降為零。地理座標仍是弱項,錯誤率為 17.5%;數學表達式則是 6.9%。用來做一般旁白沒問題,但涉及大量座標內容時就要提高警覺。
以下模型表格整理了 v3 與同系列模型的定位,資料以官方模型參考文件為準:
| 模型 | 模型 ID | 語言 | 每次請求最多字元數 | 標示延遲 | 每 1,000 字元價格 |
|---|---|---|---|---|---|
| Eleven v3 | eleven_v3 | 70+ | 5,000(約 5 分鐘) | 約 250–300 ms(依層級而定) | $0.10 |
| Eleven v3 Conversational | 透過 Text-to-Dialogue WebSocket | 70+ | 不適用 | 約 280 ms | $0.10 |
| Multilingual v2 | eleven_multilingual_v2 | 29 | 10,000(約 10 分鐘) | 約 250–300 ms | $0.10 |
| Flash v2.5 | eleven_flash_v2_5 | 32 | 40,000(約 40 分鐘) | 約 75 ms | $0.05 |
這裡有一個值得注意的文件矛盾:定價頁面把「Multilingual v2/v3」歸在每次 40,000 字元的方案限制下,但模型參考文件則把 Eleven v3 的單次上限列為 5,000 字元。實務上應以 5,000 為準,因為這是模型專屬的數字;如果長篇處理流程預設可以送出 40k,請求會直接失敗。
價格比較:ElevenLabs 官方 API 與 fal.ai
兩邊的單價都是每 1,000 字元 $0.10,同系列中只有 Flash v2.5 更便宜,為每 1,000 字元 $0.05。真正需要比較的是計費方式與平行處理能力:
| ElevenLabs 官方 | fal.ai | |
|---|---|---|
| Eleven v3 單價 | 每 1k 字元 $0.10 | 每 1k 字元 $0.10 |
| 計費方式 | 訂閱方案含額度,或隨用隨付 | 純使用量計費;「沒有席位授權、沒有訂閱、沒有最低消費」 |
| 免費方案 | 每月 10k Multilingual 字元(Flash 為 20k) | 模型頁面未標示 |
| 方案範例 | Creator 每月 $22(首月 $11),含 220k Multilingual 字元 | 不適用 |
| 最高方案 | Business 每月 $990,含 9.9M Multilingual 字元 | 不適用 |
| 並行數 | 依方案而定:Free 可同時處理 2 個 Multilingual 請求,Scale/Business 為 15–30 個,Enterprise 可客製 | 無伺服器佇列;模型頁面未記載每個帳戶的上限 |
| 排隊代價 | 超過上限後請求會排隊,「通常」增加約 50 ms | 提供佇列 API 與 webhook,適合批次工作 |
| 控制項(文件化 schema,加上使用者回報) | 以 ID 指定語音;穩定度(使用者回報 v3 有 3 段設定) | 語音、stability、similarity_boost、speed、language_code、apply_text_normalization、seed、timestamps、output_format |
| 新創方案 | 免費 12 個月、33M 字元,並提供更高並行數 | 不適用 |
官方 API 把並行能力綁在方案層級:Free 金鑰同時送出多個 v3 請求時只能處理 2 個,批次工作很容易被限流。fal 則把工作送進無伺服器佇列,並以 webhook 回呼,正好瞄準批次任務。兩邊的定價文件都沒有說明空白字元或方括號音訊標籤是否會計入計費字元,因此預算最好先假設它們都會算。
如果你只是偶爾需要 v3,而且本來就透過 fal 執行其他模型,平台差異可參考我們的 fal.ai 評測。
音訊標籤:直接在文字裡指定情緒與語氣
音訊標籤是插在文字中的方括號指令,模型會把它當成表演提示,而不是要念出來的內容。以下是 fal 模型頁面提供的基本範例:
[slowly] Back then... [chuckles] we had no phones.
[whispers] Just dirt roads and [coughs] big dreams.
[sad] Then it happened.
| 類別 | 可用範例 |
|---|---|
| 情緒 | [happy]、[sad]、[excited]、[angry]、[sarcastically]、[nervous]、[happily] |
| 表達方式 | [whispers]、[shouting]、[shouts]、[slowly]、[quickly]、[softly] |
| 非語言聲音 | [laughs]、[chuckles]、[sighs]、[gasps]、[coughs]、[gulps]、[clears throat]、[applause] |
| 口音 | [british accent]、[southern accent]、[strong canadian accent] |
官方提示詞文件有三個重點。第一,沒有一份官方認定的標籤清單;標籤本質上是自然語言指示,ElevenLabs 也表示已公開的範例之外,很可能還有更有效的寫法,所以實測比背清單重要。第二,不支援 SSML 的 break 標籤,想控制節奏要靠標點、刪節號與換行。第三,標籤效果會隨語音與上下文而變。最後一點正是問題最常出現的地方:
「V3 很驚人,絕對是最像人聲的」 「但對我來說,它仍然很像 Beta 版本」 — u/ConcertNeat8147,同一篇貼文中的兩段話,r/ElevenLabs 的 v3 實測回報
同一串討論中,擁有二十年經驗的軟體工程師 u/poundingCode 表示,加上情緒標籤後,偶爾會讓說話者的口音整個改變。ElevenLabs 的員工帳號則回覆:「這些都是我們目前正在處理的問題。」
同一串討論裡創作者分享了以下做法(屬社群經驗,並非官方建議):
- 先加一段暖聲句。 在正文前放一個只用來設定語氣與音高的句子,後製時再剪掉;不少語音在生成開始幾秒後才會逐漸「穩定」下來。
- 在結尾加上
end.。 文字後換行並加上「end.」,可減少結尾單字被截斷的情況,生成音訊後再剪掉這段。 - 句尾使用刪節號。 有人觀察到,句子以「...」結束時,單字尾端被截斷的情況會減少。
- 把穩定度調到最高。 v3 的穩定度控制有三段,最高設定可減少生成開頭的聲音漂移。
會左右整合方式的幾個限制
- 最重要的是 5,000 字元上限。 單次請求大約只能產生 5 分鐘音訊,因此有聲書與長篇內容流程都必須切段:應在句子或段落邊界切分,不要切在子句中間,也要確保標籤留在它所控制的那一段裡。如果你需要更少但更大的請求,Multilingual v2 支援 10,000 字元。
- 官方 API 的並行能力取決於方案。 根據模型參考文件:Free 金鑰可同時處理 2 個 Multilingual 層級請求(Flash 為 4 個),Scale 與 Business 為 15–30 個,Enterprise 則可協商客製上限;超過限制後排隊「通常」會增加約 50 ms。同一頁也提供 ElevenLabs 的容量估算:並行上限為 5 時,對話式工作負載大約可支援 100 個同時進行的音訊廣播。單次請求的額外延遲不高,但批次規模一大、容量配置不足,代價就會很明顯。
- fal 完全沒有文件化的輸入大小上限。 Eleven v3 頁面列出端點、參數與格式,卻沒有說明輸入上限、佇列保留時間或重試行為。你當然可以提交長文字,但文件也沒有保證它一定能正常處理。
- 時間戳記功能依平台而異。 fal 的輸入 schema 有一個
timestamps布林值,能回傳逐字對齊資料,適合字幕與口型同步。官方 API 的 v3 對話輸出則不附時間戳記,開發者也曾公開反映這個缺口(r/ElevenLabs:「v3 API, no timestamps?」);目前若需要對齊資料,fal 的參數是文件明確支援的做法。
- 即時應用仍不是 v3 的舞台。 ElevenLabs 表示,由於延遲較高且一致性不固定,v3 不適合即時與對話式使用。官方建議的選項是:需要語音代理時使用約 75 ms 的 Flash v2.5;如果互動場景不能犧牲表現力,則使用透過 WebSocket、延遲約 280 ms 的 Eleven v3 Conversational。即時版 v3 已列入路線圖(「我們正在開發即時版本」),但在正式版公告時仍未推出。
- 商業使用。 alpha 期間,開發者曾公開詢問 v3 生成內容是否可商用;正式版公告表示模型已在所有平台開放,而 fal 也直接將其端點標示為可商業使用。
第一次呼叫:官方 SDK 與 fal client
官方做法如下,內容取自快速入門文件:
pip install elevenlabs
from elevenlabs import ElevenLabs
client = ElevenLabs(api_key="YOUR_ELEVENLABS_API_KEY") # or ELEVENLABS_API_KEY env var
audio = client.text_to_speech.convert(
voice_id="JBFqnCBsd6RMkjVDRZzb", # "George"
text="[whispers] The first move is what sets everything in motion.",
model_id="eleven_v3",
output_format="mp3_44100_128",
)
fal 的做法則是使用 fal-client 呼叫 fal.run 端點:
pip install fal-client
import fal_client
result = fal_client.subscribe(
"fal-ai/elevenlabs/tts/eleven-v3",
arguments={
"text": "[whispers] The first move is what sets everything in motion.",
"voice": "Rachel", # default voice
"stability": 0.5, # 0–1, lower = more expressive variation
"timestamps": True, # per-word alignment data
},
)
print(result["audio"]["url"]) # hosted MP3 URL
兩個平台都明確提醒,不要把 API 金鑰放進用戶端程式,因此應該透過自己的伺服器代理請求。串流方面,官方 API 有串流語音端點;fal 則提供 fal.stream,另有支援 webhook 的佇列 API 可處理批次工作。
到底該呼叫哪個端點?
| 你的情境 | 建議呼叫 |
|---|---|
| 需要自己的複製語音(PVC/IVC),或要以 ID 使用設計語音 | 官方 API:工作區中的自訂語音可透過 ID 引用;fal 頁面只記載預設語音名稱 |
| 已經支付含額度的 ElevenLabs 方案 | 官方 API:方案內含字元額度本來就已付費,而每次 fal 呼叫都會產生新的支出 |
| 有聲書/配音批次工作、不想訂閱,並需要完成 webhook | fal:隨用隨付的佇列與 webhook 流程正是為這種情況設計 |
| 想在同一套技術堆疊中,用一把 API 金鑰串接影像、影片與 TTS 模型 | fal:v3 可與其他 fal 模型共用同一個 client |
| 語音代理或任何受延遲限制的應用 | 兩個 v3 TTS 端點都不適合:改用 Flash v2.5(約 75 ms)或 Eleven v3 Conversational(約 280 ms) |
| 企業需求(SOC 2、HIPAA BAA、自訂速率限制、IP 允許清單) | 官方 API:定價頁面列出 Enterprise 方案功能;fal 模型頁面沒有說明其端點涵蓋哪些認證 |
常見問題
Eleven v3 的模型 ID 是什麼?
eleven_v3,在標準文字轉語音端點中以 model_id 傳入。多人對話則使用獨立的 Text-to-Dialogue 端點,不需要傳入模型參數。
Eleven v3 API 支援串流嗎?
支援。官方 API 提供串流語音端點,會在生成音訊時逐步回傳;fal 也為同一個模型提供 fal.stream。但串流不代表 v3 適合即時使用,官方仍建議把對話用途交給 Flash v2.5 或 Eleven v3 Conversational。
Eleven v3 的字元上限是多少?
根據官方模型參考文件,每次請求最多 5,000 字元,約可生成 5 分鐘音訊。定價頁面的 40,000 字元是 Multilingual 層級的分類上限,不是 v3 的專屬限制。
Eleven v3 API 怎麼收費?
兩個平台都是每 1,000 字元 $0.10:一個 10,000 字元的故事是 $1.00,一本 1M 字元的有聲書是 $100。官方方案的額度可以抵銷部分成本(Creator 每月 $22,含 220k Multilingual 字元);fal 沒有訂閱方案。
Eleven v3 可以搭配複製語音嗎?
官方 API 可以:專業語音、複製語音與設計語音都能透過 voice ID 引用。不過實務上的相容性不一;r/ElevenLabs 使用者回報,現有 Professional Voice Clones 在 v3 下有時會聽起來像不同的說話者,而創作者標示支援 V3 的 PVC 通常表現較穩定。fal 的 schema 接受語音名稱或 ID,但文件只記載預設語音,因此私人 ElevenLabs voice ID 在 fal 上屬於未文件化用法。
Eleven v3 適合即時語音代理嗎?
不適合。ElevenLabs 明確表示,v3 因為延遲較高且一致性不固定,不適用於即時與對話式使用。請改用 Flash v2.5(約 75 ms、32 種語言),或 Eleven v3 Conversational(約 280 ms、70 多種語言,支援音訊標籤控制)。
為什麼 Eleven v3 透過 API 生成的聲音,和網站上的預覽不一樣?
語音預覽不代表你用自己的文字生成時會得到相同結果,這也是r/ElevenLabs 實測回報反覆提到的問題;而且 v3 每次生成的結果也可能有明顯差異。正式採用前,應使用實際腳本片段,並以產品預定的穩定度設定測試每個候選語音。
延伸閱讀:Qwen Audio 3 TTS API 指南 · Replicate 價格與替代方案 · fal.ai 2026 評測