AIREITER

MiniMax H3 vs LTX 2.3:オープンウェイト動画モデルを徹底比較

最終更新日: 2026-08-07 03:52:59

手元にあるのはVRAM 12 GBのRTX 3060。MiniMax H3とLTX 2.3のどちらで動画を生成するか、悩む場面は少なくありません。どちらもネイティブ音声を備えたオープンウェイトの動画モデルで、ComfyUIからローカル実行できます。ただし、片方は5秒・1080pのクリップを40秒未満で出力できる一方、もう片方は10秒・480pに11分かかることがあります。そして遅いほうの物理表現については、Redditコミュニティから「比較にならない」との評価も出ています。重要なのは優劣を一括りにすることではなく、いま必要なショット、GPU、納期にどちらが合うかです。

MiniMax H3とLTX 2.3の主な違い

項目MiniMax H3LTX 2.3
アーキテクチャ33B DiT + Qwen3-VL-32B encoderDiT-based, new VAE
最大解像度2K4K
最大尺15秒20秒(4K/1440pでは10秒)
音声ネイティブステレオ音声ネイティブ音声、改良されたボコーダー、audio-to-videoエンドポイント
LoRA対応未対応Style LoRAs、HDR IC-LoRA、character LoRAs
縦動画アスペクト比の指定で対応ネイティブ9:16、縦向きデータで学習
ローカル実行時の最小VRAM8 GB(INT8量子化)実用上は約12 GB(それ未満のGPUではOOM報告あり)
ライセンスMiniMax Community LicenseウェイトはApache 2.0、年間売上$10M超での商用利用はLTX Model License
リリースAPI:2026年7月31日、ウェイト:2026年8月3日2026年3月

両モデルは数か月差でオープンウェイトとして登場しました。LTX 2.3は5か月先行しており、LoRAの運用環境が成熟しています。一方、執筆時点でH3のウェイト公開からは8日しか経っていません。

レンダリング速度と必要ハードウェア

一部のワークフローでは、速度差が実用性を左右します。ただし、モデル容量だけで判断すると実態を見誤ります。H3は拡散ウェイトが21 GB、テキストエンコーダーが16 GBで、技術的にはより大きなモデルです。それでも、複数のユーザーはLTX 2.3よりコンシューマー向けGPUで安定して動くと報告しています。

「技術的にはLTX 2.3より大きいのに、より速く動き、メモリ問題も少ないです。最近2.3をもう一度試しましたが、メモリ消費にはうんざりしました。」 - Reddit user dobomex761604, r/StableDiffusion

ただし、安定性と速度は別の話です。同じReddit比較スレッドで共有された実測の所要時間は、以下のとおりです。

ハードウェアモデル尺 / 解像度実測時間
RTX 3060 12 GBH3 (INT8)10秒 / 480p約11分
RTX 3060 12 GBH3 (INT8)5秒 / 約480p約3〜4分
RTX 5090 24 GBH3 (full)15秒 / 720p / 20 steps48分
RTX 4080LTX 2.315秒 / 1080p15〜20分
RTX 4090LTX 2.35秒 / 1080p25〜40秒
RTX 4090Wan 2.2 (14B FP8)5秒 / 1080p90〜120秒

user srikantpatnaikによる実用的なヒントもあります。ComfyUIのサブグラフに入り、stepsを20から10へ下げると、品質低下を許容できる範囲に収めつつH3の生成時間を約40%短縮できます。現状のH3にとって最大の弱点は、解像度と尺に対する生成時間です。

VRAM要件ではH3が意外な健闘を見せます。ComfyUI配布版のINT8プルーニングモデルは、システムRAM 16 GBとVRAM 8 GBのカードでも動作します。ただし、user Aadi_880のテスト記録によれば、0.3〜0.4メガピクセル、概ね480〜600pの低解像度と5秒クリップに制限されます。LTX 2.3はVRAM 8 GBのカードでOOMが頻発するという報告があり、あるユーザーはメモリ面の体験を「惨事」と表現しています。

プロンプト追従性と物理表現はH3が優勢

速度ならLTXの領分ですが、プロンプトの理解ではH3が明確にリードします。リンク先のReddit比較スレッドでも、プロンプト追従性と物理表現を理由にH3を支持する参加者が複数いました。

「MiniMax H3は格段に使いやすい。複雑で説明過多なプロンプトを書かなくても、かなりまともなシーンを生成できる。それだけで私には決め手です。」 - Reddit user nvidiot, r/StableDiffusion

「私のテストでは、Minimaxは物理とプロンプト追従を非常によく理解しています。アクションや流血など、過激なシーンも避けません。LTXでは2段落必要だった結果を、私は4文で得られます。」 - Reddit user Fit_Satisfaction2953

物理表現の差が特に表れるのは、物体の一貫性です。LTX 2.3では、物体が互いをすり抜けたり、シーンの途中で消えたりすることが少なくありません。H3は33B DiTに加え、Qwen3-VL-32Bの50層目の隠れ状態をテキストエンコーダーとして使っています。コミュニティのテスターは、より大きなこのアーキテクチャが空間的な追跡性能の高さにつながっていると見ています。user SX2k7も「LTXでは、物が理由もなく消えたり、すり抜けたりする頻度があまりに高い」と指摘しています。

同じRedditスレッドのユーザー報告では、H3はLTXやWanより検閲が緩く、これらのモデルがデフォルトでフィルタリングするアクション、流血、激しい身体表現を含むシーンも生成しやすいとされています。

Image-to-Videoでの人物同一性

人物の同一性を維持したい用途では、H3のRef2Vid(reference-to-video)が目立ちます。キャラクター画像を入力すると、人物が画面外へ出てから戻る場面でも、クリップ全体を通して顔の同一性を保てるとコミュニティのテスターは報告しています。

LTX 2.3のimage-to-videoも今回のリリースで改善されました。フリーズや、Ken Burns風の疑似的な動きのアーティファクトは減っています。しかし、人物の見た目が途中で変わる問題は依然として知られています。

「そうです。人物がショットの10秒間はフレーム外にいて、最後に振り返るI2Vを試しましたが、顔は同一でした。LTXなら『この人誰?』となるでしょうね。」 - Reddit user kemb0

商品カット、キャラクターの一貫性、あるいは10秒のクリップを通して同じ顔を維持しなければならないブランド案件では、H3のRef2Vidがオープンウェイトモデルの中でより有力な選択肢です。

LoRAと音声連動ワークフローはLTXが強い

この領域には、現時点でH3がまだ追いつけない構造的な強みがあります。LTXエコシステムには、カスタムツールが蓄積されるだけの時間がありました。

  • Style LoRAs:特定のビジュアルスタイル(ストップモーション、ハンドクラフト、ミニチュアなど)でモデルを追加学習し、ショットごとに切り替えられる
  • HDR IC-LoRA:広いダイナミックレンジを持つHDRで直接生成でき、SDR映像を仕上げ工程向けのEXRへ変換することも可能
  • Audio-to-video endpoint:音声クリップを渡すと、それに合う映像を生成する。音楽主体のコンテンツや、音と動きの同期が重要なSNS動画に有用
  • ComfyUIのseedhunter/directorワークフロー:最適な出力を探すためにseedを反復し、その後に構図を磨き込む、コミュニティ製のマルチパスパイプライン
  • ネイティブ9:16:横長映像を切り抜くのではなく、縦向きデータで学習済み。縦型SNSコンテンツでは重要
  • 24/48 FPS:納品仕様に合わせやすいフレームレートの選択肢

これに対してH3のワークフローは、音声付きのtext-to-video、image-to-video、reference-to-videoが中心です。LoRA学習パイプライン、スタイルアダプター、HDR出力はありません。執筆時点でモデル公開から8日しか経っていないため、こうした差は今後縮まる可能性があります。ただ現状では、LTX用LoRAライブラリや調整済みのComfyUIグラフを構築済みのクリエイターにとって、乗り換えには現実的なコストが伴います。

user l2dditは、この両者の緊張関係をこう表現しています。「問題を直す役に立たなかったLTX LoRAを、ようやく全部削除できます。LTXが優れていた唯一の点は、英語以外の音声リップシンクでした。」

ローカル実行とAPIのコスト比較

ライセンスの面では、どちらもローカル実行は無料です。ただし実際には、生成待ち時間がコストになります。ホステッドAPIを使う場合、料金差は大きくなります。

エンドポイントLTX 2.3 (fal.ai)MiniMax H3 (hosted)
Text-to-video 1080p$0.06/秒API料金は未公表
Text-to-video 4K/2K$0.24/秒(4K)API料金は未公表
Fast variant 1080p$0.04/秒N/A
Audio-to-video$0.10/秒動画料金に含まれる
Image-to-video$0.06〜0.24/秒動画料金に含まれる
Extend / Retake$0.10/秒未提供

具体例として、fal.ai経由でLTX 2.3を使い、5秒・1080pのクリップを生成する料金は$0.30です。Fast variantなら$0.20まで下がります。MiniMax H3のホステッドAPI料金は、執筆時点では公開されていません。ローカルではどちらも無料で動かせますが、RTX 3060でH3を11分レンダリングするとなると、試行回数に対するコストは無視できません。

LTX 2.3のウェイトはHuggingFaceでApache 2.0のもと提供されており、年間売上$10M超の企業における商用組み込みはLTX Model Licenseが規定します。H3のウェイトはHuggingFaceでMiniMax Community Licenseのもと公開されています。どちらもローカルかつオフラインで利用できます。LTX 2.3のAPI料金はfal.aiのモデルページを参照しています。

制作現場での使い分け

大半のクリエイターにとって、どちらか一方だけを選ぶ必要はありません。両者の得意分野に合わせて使い分けるハイブリッド構成が合理的です。

H3を選ぶ場面:

  • 衝突、高速移動、物理的な相互作用など、複雑な物理表現が必要なショット
  • 商品紹介や物語シーンなど、長いクリップで人物の同一性を保つ必要がある場合
  • 別途の音声処理なしでネイティブステレオ音声がほしい場合
  • プロンプトを簡潔に済ませたい場合(4文対2段落)
  • GPUがローエンド寄り(VRAM 8〜12 GB)で、生成時間の長さを受け入れられる場合

LTX 2.3を選ぶ場面:

  • 絵コンテ、タイミング確認、ラフプレビューなど、高速な反復が必要な場合
  • 独自のLoRAが映像スタイルを規定している場合
  • 縦型9:16のSNSコンテンツを納品する場合
  • 4K解像度が必須の場合(H3は2Kまで)
  • 既存の音声トラックを映像の動きに反映するaudio-to-video同期が必要な場合
  • 1フレームごとの最高品質よりも速度を優先する場合

実用的な流れとしては、まずLTX Fastでブロッキングとタイミングを確認し、承認されたショットをH3に回して、物理表現、人物同一性、音声を含む最終レンダリングを行う方法があります。アップスケーラーによる後処理は、ショットが承認されてからにしましょう。H3は再レンダリングの時間コストが大きいため、先にショットを固める価値があります。

FAQ

MiniMax H3はLTX 2.3より優れていますか?

品質、プロンプト追従性、人物同一性ではH3が優勢です。速度、LoRAカスタマイズ、4K出力ではLTX 2.3が優れます。ブランド名で決めるのではなく、ショットの種類で振り分けるべきです。

MiniMax H3はコンシューマー向けGPUで動作しますか?

はい。INT8プルーニングモデルは、VRAM 8 GBとRAM 16 GBで、おおむね480〜600p・5秒の条件なら動作します。フル精度のH3はVRAM 24 GBの恩恵を受けます。

H3はLoRAファインチューニングに対応していますか?

まだ対応していません。2026年8月3日のウェイト公開時点で、H3にはLoRAパイプラインがありません。LTX 2.3はStyle LoRAs、HDR IC-LoRAs、character LoRAsをサポートしています。

音声品質が優れているのはどちらですか?

どちらもネイティブ音声を生成します。H3はより豊かな環境音のディテールを持つステレオ音声を生成します。LTX 2.3はボコーダーが改善され、よりクリーンな出力になっているほか、入力音声クリップから映像を生成するaudio-to-videoエンドポイントも備えます。

各モデルに必要なVRAMはどの程度ですか?

H3 INT8は、480pで動かすにはVRAM 8 GBとRAM 16 GBが最低ラインです。フル精度のH3はVRAM 24 GBの恩恵を受けます。LTX 2.3は実用上およそVRAM 12 GBが最低ラインで、VRAM 8 GBのカードではOOM報告があります。