2026 年 7 月下旬,MiniMax H3 和 Flux 3 在相隔數天內推出。很快地,Reddit 使用者便拿同一組提示詞分別測試兩款模型,想知道誰才是真正贏家。結論其實很明確:H3 在解析度、音訊細節與多模態參考控制上更有優勢;Flux 3 則勝在創作彈性、片段長度與電影化風格。沒有任何一款能橫掃所有項目,該怎麼選,仍取決於你的工作流程最重視哪些輸出規格。
真正拉開差距的規格
MiniMax H3 和 Flux 3 在基本能力上其實相當接近:兩者都能根據文字與圖片輸入生成帶有原生音訊的影片。不過,它們的上限由截然不同的工程取向決定,差異主要落在以下規格:
| 功能 | MiniMax H3 | Flux 3 Video |
|---|---|---|
| 最高解析度 | 2K(預設) | 720p / 1080p |
| 最長片段 | 15 秒 | 20 秒 |
| 音訊 | 原生立體聲 | 始終開啟(環境音 + 對白) |
| 參考素材輸入 | 最多 9 張圖片、3 支影片、3 段音訊(上限 12 個檔案) | 起始影格,或首尾影格 |
| 開放權重 | 是(HuggingFace) | 否(僅限 Early Access API) |
| 模式 | 文字轉影片、圖片轉影片、參考素材轉影片、首尾影格 | 文字轉影片、圖片轉影片、影片轉影片、關鍵影格轉影片、音訊延續 |
H3 最高可輸出 2K,但單段最長 15 秒;Flux 3 可做到 20 秒,解析度則止於 1080p。工作流程上還有一項關鍵限制:根據 MiniMax V2 API 文件,H3 的 API 將參考素材模式與首尾影格模式視為互斥,無法同時使用。
生成 10 秒影片要花多少錢?
實際費用會因使用的供應商而有明顯差異。MiniMax 透過自家平台 API 直接提供 H3;Flux 3 則可經由 Black Forest Labs Early Access 與合作平台取得。
| 供應商 | 模型 | 解析度 | 每秒費用 | 10 秒影片費用 |
|---|---|---|---|---|
| MiniMax platform | H3 | 2K | $0.13 | $1.30 |
| MiniMax platform | H3 | 768p(beta) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | ~100 credits/s | ~1,000 credits |
| LetzAI | Flux 3 | 1080p | ~160 credits/s | ~1,600 credits |
若直接使用 MiniMax 的 API,H3 的 2K 生成費用為每秒 $0.13,是目前最便宜的途徑,15 秒影片價格為 $1.95;fal.ai 的價格則翻倍至每秒 $0.26。Flux 3 使用的 credits 與 MiniMax 的美元計價方式不同,在不知道各供應商 credits 換算美元比例的情況下,兩者無法直接比較。
音訊表現:H3 明顯領先
一位以相同提示詞測試兩款模型的 Reddit 使用者,直接給出了這樣的評語:
「不過我注意到一件事,尤其戴上耳機後,Minimax H3 在音訊部門完全輾壓 Flux 3。最後兩段尤其明顯;如果你戴著耳機,閉上眼睛再播放一次這支影片,只聽音質差異就知道了。Flux 3 不只是比較差,而是音訊真的明顯較差。」-GrayingGamer,r/StableDiffusion
H3 能生成原生立體聲,對白、環境噪音與物理效果都會被混入合理的立體聲場。Flux 3 也一律包含音訊,且不能關閉;部分聲線的對白聽起來甚至可能更自然。然而,它的環境音與場景聲層次明顯較平。若是自然紀錄片或動畫場景,H3 的聲景更能營造沉浸感,這點 Flux 3 目前追不上。
人聲品質的差距並非單向碾壓。部分聽眾認為 Flux 3 的維京角色聲音更自然;H3 的卡通角色與紀錄片旁白則被評為更有表情。兩款模型都還稱不上能直接用於廣播等級成品,但在環境音設計方面,H3 的優勢相當清楚。
畫質表現要看場景類型
在一項涵蓋 四組提示詞的 Reddit 比較中,兩款模型各自在不同場景勝出:
Flux 3 勝出:電影感維京長船場景,以及第一人稱騎龍飛行畫面。Flux 3 的電影色彩分級更好、動態中的人物更可信,整體電影感也更強。年代片常見的底片顆粒、鏡頭壓縮感與黃金時刻光線,正是 BFL 模型特別擅長的風格。
H3 勝出:一段水中涉行的水晶翅膀生物自然紀錄片,以及 2D 動畫風格的卡通骷髏女孩。H3 在 2K 下呈現更銳利的細節,生物翅膀的材質一致性也更佳,卡通風格的角色動畫表情更豐富。紀錄片旁白與畫面節奏的同步也相當乾淨。
不過,這項結果有一個重要前提:Reddit 測試者拿 H3 的消費級 int8 量化模型,對比 Flux 3 的完整 API 版本。留言者 Pyros-SD-Models 指出,H3 在完整 bf16 精度下,維京場景「比 OP 貼出的效果好得多」,這表示開放權重模型在完整精度時,可能會縮小量化版本所呈現的電影感差距。這些結論來自單次四組提示詞測試,而非系統化基準測試。
兩款模型的物理正確性仍不穩定。Reddit 使用者 kaidu 表示:「H3 雖然很好,但仍有不少瑕疵與物理問題。而且很奇怪的是,這些問題似乎出現得相當隨機。就像你的範例:水上行走的龍看起來非常真實,但划船的人看起來卻糟透了。」Flux 3 也有類似的隨機失誤,例如維京場景中的步行循環就被形容為「很可怕」。
多模態參考:H3 的決定性優勢
根據 MiniMax V2 API,H3 單次生成可接受最多 9 張圖片、3 支影片與 3 段音訊作為參考素材,總數上限為 12 個檔案。你可以直接用自然語言下指令,例如:「參考影片 1 的 Hitchcock 鏡頭運動,讓圖片 2 的角色唱歌,並使人聲符合音訊 3。」H3 會在內部處理這些跨素材關聯。
依照 BFL 的 FLUX 3 文件,Flux 3 僅支援起始影格的圖片轉影片,或以首尾影格組合製作關鍵影格動畫。你無法同時餵給它風格參考圖、動作參考影片與音訊參考。
對商業工作流程來說,例如產品鏡頭、維持品牌一致性的廣告素材,或需要延續參考內容的角色場景,這是決定性的功能差距。但代價同樣存在:H3 的 API 將參考素材模式與首尾影格模式設為互斥,不能在同一次 API 呼叫中混用多模態參考與端點關鍵影格。
供應商生態與取得方式
| 取得途徑 | MiniMax H3 | Flux 3 |
|---|---|---|
| 官方 API | platform.minimax.io | bfl.ai/models/flux-3(Early Access) |
| 第三方 API | fal.ai、Krea、OpenArt、Sogni | LetzAI、Comfy Cloud、fal.ai |
| 開放權重 | HuggingFace | 尚未提供(規劃推出 FLUX 3 Dev) |
| 本機部署 | ComfyUI(int8/bf16 GGUF) | 否 |
H3 在推出後數天內便釋出開放權重,目前可於 HuggingFace 取得。開發者已透過 ComfyUI 執行量化的 GGUF 版本。Flux 3 仍屬閉源模型;BFL 的發布計畫列有預計推出的開放權重版本「FLUX 3 Dev」,但尚未公布日期。
該選哪一款模型?
| 你的優先需求 | 建議選擇 | 原因 |
|---|---|---|
| 最高解析度 | H3 | 原生 2K,高於 Flux 3 的 1080p 上限 |
| 最長單段影片 | Flux 3 | 20 秒,H3 為 15 秒 |
| 音訊品質 | H3 | 立體聲與更豐富的環境音 |
| 多模態參考 | H3 | 單次呼叫可使用 9 張圖片 + 影片 + 音訊 |
| 電影感 / 復古風格 | Flux 3 | 色彩分級與電影美學更出色 |
| 已公布的官方直連 API 價格 | H3 | MiniMax 直接提供 2K 每秒 $0.13;Flux 3 的 credits 定價依供應商而異 |
| 影片轉影片 | Flux 3 | H3 無法透過同一端點提供 V2V |
| 開放權重 / 本機執行 | H3 | 權重現已可用;Flux 3 仍是閉源 |
| 商業產品影片 | H3 | 文字與品牌呈現、參考一致性及 2K 細節 |
| 創意影片製作 | Flux 3 | 提示詞驅動的藝術 निर्देशन與風格範圍更好 |
整體脈絡很清楚:只要你在意精準度、解析度、參考還原度,或已公布的官方直連 API 價格,就選 H3。若創意方向比技術規格更重要,且你需要更長鏡頭、風格化美學或影片轉影片工作流程,Flux 3 會更合適。
能否突破單段時長上限,串接更長影片?
可以,但兩者的做法不同。H3 的首尾影格模式可將一段影片的最後一格作為下一段的起始影格,讓兩段 15 秒片段延續成約 30 秒的序列。共享的關鍵影格有助於維持構圖與角色身分一致。Flux 3 則支援 BFL 所稱的「agentic chaining」:透過視覺參考串聯個別片段,形成多鏡頭序列,並讓角色在不同場景間保持一致。兩款模型都無法單次生成超過各自標示上限的影片,但只要事先規劃,都能延伸成更長的成片。
常見問題
MiniMax H3 可以在本機執行嗎?
可以。MiniMax 在推出後不久,便於 HuggingFace 發布了H3 模型權重。社群已提供 ComfyUI 設定,可使用 int8 與 bf16 GGUF 格式。完整精度模型需要大量 VRAM,但量化版本可在消費級 GPU 上執行。
哪一款模型在影片內文字渲染的表現更好?
根據 MiniMax 的官方測試,H3 在生成影片影格內的文字與品牌 Logo 渲染表現更強。對廣告工作流程而言,若產品名稱或 UI 文字必須正確出現在輸出畫面中,這項能力尤其重要。