AIREITER

MiniMax H3 vs LTX 2.3:開放權重影片模型正面對決

最近更新: 2026-08-07 03:54:31

手上只有一張 12 GB VRAM 的 RTX 3060,下一支影片該丟給 MiniMax H3 還是 LTX 2.3?兩者都是支援原生音訊、可透過 ComfyUI 在本機執行的開放權重影片模型,但使用體驗差距很大:一款能在不到 40 秒產出 5 秒 1080p 片段,另一款生成 10 秒 480p 就要 11 分鐘。不過,慢的那一款在物理表現上,被 Reddit 社群形容為「根本不是同個等級」。真正該問的不是誰全面更強,而是眼前這個鏡頭、你的硬體條件與交件時間,究竟適合哪一款。

MiniMax H3 與 LTX 2.3 規格快速對照

項目MiniMax H3LTX 2.3
架構33B DiT + Qwen3-VL-32B encoderDiT-based, new VAE
最高解析度2K4K
最長片長15 秒20 秒(4K/1440p 為 10 秒)
音訊原生立體聲原生音訊、更乾淨的 vocoder、audio-to-video endpoint
LoRA 支援尚未支援Style LoRAs、HDR IC-LoRA、character LoRAs
直式模式透過長寬比控制原生 9:16,使用直式資料訓練
本機最低 VRAM8 GB(INT8 量化)實務上約 12 GB(較低階顯卡有 OOM 回報)
授權MiniMax Community LicenseApache 2.0 weights;年營收超過 $10M 的商業用途採 LTX Model License
發布時間API:2026 年 7 月 31 日;weights:2026 年 8 月 3 日2026 年 3 月

兩款模型相隔數個月先後以開放權重形式推出。LTX 2.3 早了五個月上市,LoRA 工作流程已相當成熟;本文撰寫時,H3 的 weights 才發布八天。

渲染速度與硬體負擔,才是工作流的分水嶺

對某些製作流程來說,速度差距大到難以接受;而且只看模型規模,很容易得到錯誤結論。H3 的體積其實更大,diffusion weights 為 21 GB、text encoder 為 16 GB,但有多位使用者表示,它在消費級硬體上的執行穩定性反而比 LTX 2.3 好:

「雖然它在技術上比 LTX 2.3 更大,但跑起來更快,記憶體問題也比較少。我最近又試了一次 2.3,記憶體用量實在讓人很煩。」-Reddit 使用者 dobomex761604,r/StableDiffusion

但穩定不等於快。以下是同一篇 Reddit 比較討論串中提供的實際耗時:

硬體模型片長/解析度實際耗時
RTX 3060 12 GBH3 (INT8)10 秒/480p約 11 分鐘
RTX 3060 12 GBH3 (INT8)5 秒/約 480p約 3 至 4 分鐘
RTX 5090 24 GBH3 (full)15 秒/720p/20 steps48 分鐘
RTX 4080LTX 2.315 秒/1080p15 至 20 分鐘
RTX 4090LTX 2.35 秒/1080p25 至 40 秒
RTX 4090Wan 2.2 (14B FP8)5 秒/1080p90 至 120 秒

使用者 srikantpatnaik 分享了一個實用做法:進入 ComfyUI subgraph,將 steps 從 20 降到 10,在可接受的畫質損失下,大約能節省 H3 40% 的生成時間。以每秒影片、每單位解析度所需時間來看,這正是 H3 現階段最大的弱點。

VRAM 表現則讓人有些意外。ComfyUI 官方發行的 INT8-pruned H3 模型,在搭配 16 GB 系統 RAM 時,最低可於 8 GB VRAM 顯卡上執行;不過依 使用者 Aadi_880 的測試筆記,只能處理較低解析度,約 0.3 至 0.4 megapixels、約 480 至 600p,以及 5 秒片段。相較之下,LTX 2.3 使用者常回報 8 GB 顯卡發生 OOM,有人甚至形容記憶體體驗是「一場災難」。

提示詞理解與物理感:H3 的明顯優勢

速度是 LTX 的主場,提示詞理解則是 H3 拉開差距的項目。前述 Reddit 比較討論串中,多位參與者都認為 H3 在提示詞遵循與物理表現上更好:

「MiniMax H3 明顯更好上手。不必寫出複雜又堆滿描述的提示詞,也能生成相當不錯的場景。光是這點就讓我選它了。」-Reddit 使用者 nvidiot,r/StableDiffusion

「依我的測試,Minimax 對物理和提示詞的理解非常好。它不會迴避動作或血腥這類較激烈的場景。同樣的結果,我用 4 句話就能讓它做到,LTX 卻得寫上 2 段。」-Reddit 使用者 Fit_Satisfaction2953

兩者的物理差異,主要出現在物件恆存性。LTX 2.3 常會讓物件彼此穿透,或在場景進行中突然消失。H3 採用 33B DiT,並以 Qwen3-VL-32B 第 50 層的 hidden states 作為 text encoder;社群測試者認為,這套更大的架構正是它空間追蹤更強的原因。使用者 SX2k7 指出:「LTX 太常毫無理由地讓東西消失,或是直接穿過彼此。」

同一個 Reddit 討論串也有使用者表示,H3 的限制比 LTX 與 Wan 少,可處理動作場景、血腥畫面與高強度肢體互動;後兩者預設會對這類內容進行過濾。

Image-to-Video 的人物一致性:H3 的 Ref2Vid 更可靠

若在意角色身分維持,H3 的 Ref2Vid(reference-to-video)是很突出的功能。輸入一張角色圖片後,社群測試者表示,即使角色離開畫面再回來,模型仍能在完整片段中維持同一張臉。

LTX 2.3 的 image-to-video 在這次版本已有進步,例如較少定格,也減少了 Ken Burns 式的假運鏡,但人物身分漂移依然是已知問題:

「對,我試過一支 I2V:角色在鏡頭外待了 10 秒,最後才回頭看鏡頭,臉還是一模一樣。LTX 的反應則像是:『這誰?』」-Reddit 使用者 kemb0

若是產品鏡頭、角色連貫性或品牌內容,且同一張臉必須在 10 秒片段中維持一致,H3 的 Ref2Vid 是開放權重模型裡較強的選擇。

LoRA 與音訊驅動工作流:LTX 的客製化護城河

這是 LTX 2.3 目前仍具結構性優勢、H3 暫時無法追上的地方。LTX 生態系已累積數個月的客製化工具與工作流:

  • Style LoRAs:針對特定視覺風格進行微調,例如 stop-motion、handcrafted、miniature,並可依鏡頭切換使用
  • HDR IC-LoRA:直接生成具延展動態範圍的 HDR 內容,或將 SDR 影片轉為 EXR,以便進入後期製作流程
  • Audio-to-video endpoint:輸入音訊片段後,由 LTX 生成相符畫面,適合音樂導向內容,以及重視聲音與動作同步的社群短片
  • ComfyUI seedhunter 與 director workflows:由社群建立的多階段流程,先迭代 seeds 找出最佳輸出,再微調構圖
  • 原生直式 9:16:以直式資料訓練,並非從橫式畫面裁切而來,對直式社群內容很關鍵
  • 24/48 FPS 選項:可彈性配合成品規格所需的幀率

H3 的工作流相對精簡:具備帶音訊的 text-to-video、image-to-video 與 reference-to-video,但沒有 LoRA 訓練流程、style adapters 或 HDR 輸出。本文撰寫時模型才發布八天,這些落差未來可能縮小;但目前手上已有 LTX LoRA 資料庫與調校完成 ComfyUI graphs 的創作者,切換平台確實有成本。

使用者 l2ddit 很精準地點出這種拉扯:「我很高興終於可以刪掉那些根本無法解決問題的 LTX loras。LTX 唯一做得比較好的,就是非英文語音同步。」

成本怎麼算:本機執行與 API 的差別

從授權成本來看,兩款模型都能免費在本機執行;但真正的成本是時間。若使用託管 API,價格差距就相當明顯:

EndpointLTX 2.3 (fal.ai)MiniMax H3 (hosted)
Text-to-video 1080p$0.06/s尚未公布 API 定價
Text-to-video 4K/2K$0.24/s (4K)尚未公布 API 定價
Fast variant 1080p$0.04/sN/A
Audio-to-video$0.10/s包含於影片生成中
Image-to-video$0.06-0.24/s包含於影片生成中
Extend / Retake$0.10/s尚未提供

換算成具體預算,透過 fal.ai 生成一支 LTX 2.3 的 5 秒 1080p 片段,費用是 $0.30;使用 Fast variant 可降至 $0.20。本文撰寫時,MiniMax H3 的 hosted API 定價尚未公開。本機執行兩者都不收費,但 H3 在 3060 上一次要渲染 11 分鐘,反覆調整鏡頭時仍會形成實際成本。

LTX 2.3 weights 可在 HuggingFace 取得,採 Apache 2.0;年營收超過 $10M 的公司若進行商業嵌入,則適用 LTX Model License。H3 weights 位於 HuggingFace,採 MiniMax Community License。兩者都允許本機離線使用。LTX 2.3 的 API 定價來源為 fal.ai 的模型頁面。

實務分流:不同鏡頭該交給誰

大多數創作者其實不必二選一。混合式工作流能讓兩款模型各自發揮所長:

遇到以下情況,交給 H3:

  • 鏡頭需要複雜物理效果,例如碰撞、快速運動與物件互動
  • 角色身分必須在較長片段中保持一致,例如產品揭露或敘事場景
  • 希望直接取得原生立體聲,不想額外處理音訊
  • 想以較簡單的提示詞工作,例如 4 句話而非 2 段文字
  • GPU 屬於較低規格的 8 至 12 GB VRAM,但可接受較長渲染時間

遇到以下情況,交給 LTX 2.3:

  • 需要快速迭代,例如分鏡、節奏測試與草稿預覽
  • 已有自訂 LoRA 定義你的視覺風格
  • 成品是直式 9:16 社群內容
  • 必須輸出 4K,因為 H3 最高只有 2K
  • 需要 audio-to-video 同步,讓既有音軌驅動畫面
  • 速度比單幀最高品質更重要

一個實用流程是:先用 LTX Fast 確認走位與節奏,再把定案鏡頭交給 H3,以更好的物理、人物一致性與音訊完成最終渲染。鏡頭確認後才進行 upscaler 後製。畢竟 H3 重跑一次的時間成本很高,先把鏡頭做對更划算。

常見問題

MiniMax H3 比 LTX 2.3 好嗎?

H3 在畫質、提示詞遵循與人物一致性方面更好;LTX 2.3 則在速度、LoRA 客製化與 4K 輸出勝出。應依鏡頭類型分流,而非只看品牌選模型。

MiniMax H3 能在消費級 GPU 上運行嗎?

可以。INT8-pruned 模型可在 8 GB VRAM + 16 GB RAM 上執行,大約可處理 480 至 600p、5 秒片段。Full-precision H3 則受益於 24 GB VRAM。

H3 支援 LoRA 微調嗎?

尚未支援。截至 2026 年 8 月 3 日 weights 發布時,H3 還沒有 LoRA pipeline。LTX 2.3 支援 Style LoRAs、HDR IC-LoRAs 與 character LoRAs。

哪一款模型的音訊更好?

兩者都能生成原生音訊。H3 可產生具有更豐富環境細節的立體聲;LTX 2.3 改善了 vocoder,輸出更乾淨,並提供 audio-to-video endpoint,可從輸入音訊片段生成畫面。

兩款模型各需要多少 VRAM?

H3 INT8:生成 480p 的最低需求為 8 GB VRAM + 16 GB RAM。Full-precision H3 受益於 24 GB VRAM。LTX 2.3:實務最低約為 12 GB VRAM,8 GB 顯卡已有 OOM 回報。