AIREITER

MiniMax H3 vs Flux 3 Video:2026 正面對決比較

最近更新: 2026-08-07 03:19:21

2026 年 7 月下旬,MiniMax H3 和 Flux 3 在相隔數天內推出。很快地,Reddit 使用者便拿同一組提示詞分別測試兩款模型,想知道誰才是真正贏家。結論其實很明確:H3 在解析度、音訊細節與多模態參考控制上更有優勢;Flux 3 則勝在創作彈性、片段長度與電影化風格。沒有任何一款能橫掃所有項目,該怎麼選,仍取決於你的工作流程最重視哪些輸出規格。

MiniMax H3 官方公告頁面,展示具備原生立體聲能力的 2K 影片

真正拉開差距的規格

MiniMax H3 和 Flux 3 在基本能力上其實相當接近:兩者都能根據文字與圖片輸入生成帶有原生音訊的影片。不過,它們的上限由截然不同的工程取向決定,差異主要落在以下規格:

功能MiniMax H3Flux 3 Video
最高解析度2K(預設)720p / 1080p
最長片段15 秒20 秒
音訊原生立體聲始終開啟(環境音 + 對白)
參考素材輸入最多 9 張圖片、3 支影片、3 段音訊(上限 12 個檔案)起始影格,或首尾影格
開放權重是(HuggingFace)否(僅限 Early Access API)
模式文字轉影片、圖片轉影片、參考素材轉影片、首尾影格文字轉影片、圖片轉影片、影片轉影片、關鍵影格轉影片、音訊延續

H3 最高可輸出 2K,但單段最長 15 秒;Flux 3 可做到 20 秒,解析度則止於 1080p。工作流程上還有一項關鍵限制:根據 MiniMax V2 API 文件,H3 的 API 將參考素材模式與首尾影格模式視為互斥,無法同時使用。

Black Forest Labs 的 FLUX 3 官方部落格頁面,展示多模態影片能力

生成 10 秒影片要花多少錢?

實際費用會因使用的供應商而有明顯差異。MiniMax 透過自家平台 API 直接提供 H3;Flux 3 則可經由 Black Forest Labs Early Access 與合作平台取得。

供應商模型解析度每秒費用10 秒影片費用
MiniMax platformH32K$0.13$1.30
MiniMax platformH3768p(beta)$0.09$0.90
fal.aiH32K$0.26$2.60
LetzAIFlux 3720p~100 credits/s~1,000 credits
LetzAIFlux 31080p~160 credits/s~1,600 credits

若直接使用 MiniMax 的 API,H3 的 2K 生成費用為每秒 $0.13,是目前最便宜的途徑,15 秒影片價格為 $1.95;fal.ai 的價格則翻倍至每秒 $0.26。Flux 3 使用的 credits 與 MiniMax 的美元計價方式不同,在不知道各供應商 credits 換算美元比例的情況下,兩者無法直接比較。

音訊表現:H3 明顯領先

一位以相同提示詞測試兩款模型的 Reddit 使用者,直接給出了這樣的評語:

「不過我注意到一件事,尤其戴上耳機後,Minimax H3 在音訊部門完全輾壓 Flux 3。最後兩段尤其明顯;如果你戴著耳機,閉上眼睛再播放一次這支影片,只聽音質差異就知道了。Flux 3 不只是比較差,而是音訊真的明顯較差。」-GrayingGamer,r/StableDiffusion

H3 能生成原生立體聲,對白、環境噪音與物理效果都會被混入合理的立體聲場。Flux 3 也一律包含音訊,且不能關閉;部分聲線的對白聽起來甚至可能更自然。然而,它的環境音與場景聲層次明顯較平。若是自然紀錄片或動畫場景,H3 的聲景更能營造沉浸感,這點 Flux 3 目前追不上。

人聲品質的差距並非單向碾壓。部分聽眾認為 Flux 3 的維京角色聲音更自然;H3 的卡通角色與紀錄片旁白則被評為更有表情。兩款模型都還稱不上能直接用於廣播等級成品,但在環境音設計方面,H3 的優勢相當清楚。

畫質表現要看場景類型

在一項涵蓋 四組提示詞的 Reddit 比較中,兩款模型各自在不同場景勝出:

Flux 3 勝出:電影感維京長船場景,以及第一人稱騎龍飛行畫面。Flux 3 的電影色彩分級更好、動態中的人物更可信,整體電影感也更強。年代片常見的底片顆粒、鏡頭壓縮感與黃金時刻光線,正是 BFL 模型特別擅長的風格。

H3 勝出:一段水中涉行的水晶翅膀生物自然紀錄片,以及 2D 動畫風格的卡通骷髏女孩。H3 在 2K 下呈現更銳利的細節,生物翅膀的材質一致性也更佳,卡通風格的角色動畫表情更豐富。紀錄片旁白與畫面節奏的同步也相當乾淨。

不過,這項結果有一個重要前提:Reddit 測試者拿 H3 的消費級 int8 量化模型,對比 Flux 3 的完整 API 版本。留言者 Pyros-SD-Models 指出,H3 在完整 bf16 精度下,維京場景「比 OP 貼出的效果好得多」,這表示開放權重模型在完整精度時,可能會縮小量化版本所呈現的電影感差距。這些結論來自單次四組提示詞測試,而非系統化基準測試。

兩款模型的物理正確性仍不穩定。Reddit 使用者 kaidu 表示:「H3 雖然很好,但仍有不少瑕疵與物理問題。而且很奇怪的是,這些問題似乎出現得相當隨機。就像你的範例:水上行走的龍看起來非常真實,但划船的人看起來卻糟透了。」Flux 3 也有類似的隨機失誤,例如維京場景中的步行循環就被形容為「很可怕」。

多模態參考:H3 的決定性優勢

根據 MiniMax V2 API,H3 單次生成可接受最多 9 張圖片、3 支影片與 3 段音訊作為參考素材,總數上限為 12 個檔案。你可以直接用自然語言下指令,例如:「參考影片 1 的 Hitchcock 鏡頭運動,讓圖片 2 的角色唱歌,並使人聲符合音訊 3。」H3 會在內部處理這些跨素材關聯。

依照 BFL 的 FLUX 3 文件,Flux 3 僅支援起始影格的圖片轉影片,或以首尾影格組合製作關鍵影格動畫。你無法同時餵給它風格參考圖、動作參考影片與音訊參考。

對商業工作流程來說,例如產品鏡頭、維持品牌一致性的廣告素材,或需要延續參考內容的角色場景,這是決定性的功能差距。但代價同樣存在:H3 的 API 將參考素材模式與首尾影格模式設為互斥,不能在同一次 API 呼叫中混用多模態參考與端點關鍵影格。

供應商生態與取得方式

取得途徑MiniMax H3Flux 3
官方 APIplatform.minimax.iobfl.ai/models/flux-3(Early Access)
第三方 APIfal.ai、Krea、OpenArt、SogniLetzAI、Comfy Cloud、fal.ai
開放權重HuggingFace尚未提供(規劃推出 FLUX 3 Dev)
本機部署ComfyUI(int8/bf16 GGUF)否

H3 在推出後數天內便釋出開放權重,目前可於 HuggingFace 取得。開發者已透過 ComfyUI 執行量化的 GGUF 版本。Flux 3 仍屬閉源模型;BFL 的發布計畫列有預計推出的開放權重版本「FLUX 3 Dev」,但尚未公布日期。

該選哪一款模型?

你的優先需求建議選擇原因
最高解析度H3原生 2K,高於 Flux 3 的 1080p 上限
最長單段影片Flux 320 秒,H3 為 15 秒
音訊品質H3立體聲與更豐富的環境音
多模態參考H3單次呼叫可使用 9 張圖片 + 影片 + 音訊
電影感 / 復古風格Flux 3色彩分級與電影美學更出色
已公布的官方直連 API 價格H3MiniMax 直接提供 2K 每秒 $0.13;Flux 3 的 credits 定價依供應商而異
影片轉影片Flux 3H3 無法透過同一端點提供 V2V
開放權重 / 本機執行H3權重現已可用;Flux 3 仍是閉源
商業產品影片H3文字與品牌呈現、參考一致性及 2K 細節
創意影片製作Flux 3提示詞驅動的藝術 निर्देशन與風格範圍更好

整體脈絡很清楚:只要你在意精準度、解析度、參考還原度,或已公布的官方直連 API 價格,就選 H3。若創意方向比技術規格更重要,且你需要更長鏡頭、風格化美學或影片轉影片工作流程,Flux 3 會更合適。

能否突破單段時長上限,串接更長影片?

可以,但兩者的做法不同。H3 的首尾影格模式可將一段影片的最後一格作為下一段的起始影格,讓兩段 15 秒片段延續成約 30 秒的序列。共享的關鍵影格有助於維持構圖與角色身分一致。Flux 3 則支援 BFL 所稱的「agentic chaining」:透過視覺參考串聯個別片段,形成多鏡頭序列,並讓角色在不同場景間保持一致。兩款模型都無法單次生成超過各自標示上限的影片,但只要事先規劃,都能延伸成更長的成片。

常見問題

MiniMax H3 可以在本機執行嗎?

可以。MiniMax 在推出後不久,便於 HuggingFace 發布了H3 模型權重。社群已提供 ComfyUI 設定,可使用 int8 與 bf16 GGUF 格式。完整精度模型需要大量 VRAM,但量化版本可在消費級 GPU 上執行。

哪一款模型在影片內文字渲染的表現更好?

根據 MiniMax 的官方測試,H3 在生成影片影格內的文字與品牌 Logo 渲染表現更強。對廣告工作流程而言,若產品名稱或 UI 文字必須正確出現在輸出畫面中,這項能力尤其重要。