如果你手上是一张 12 GB 显存的 RTX 3060,准备在 MiniMax H3 和 LTX 2.3 之间二选一,答案很可能不取决于谁的参数更大。两者都是支持原生音频、可通过 ComfyUI 本地运行的开源权重视频模型;但一边能在不到 40 秒内生成 5 秒 1080p 视频,另一边生成 10 秒 480p 可能要花 11 分钟。偏偏后者的物理表现,又被 Reddit 社区评价为“完全不是一个级别”。真正该问的不是哪个模型绝对更好,而是眼前这个镜头、你的硬件和交付时间,更适合哪一个。
MiniMax H3 与 LTX 2.3 参数速览
| 项目 | MiniMax H3 | LTX 2.3 |
|---|---|---|
| 架构 | 33B DiT + Qwen3-VL-32B encoder | 基于 DiT,采用新版 VAE |
| 最高分辨率 | 2K | 4K |
| 最长时长 | 15 秒 | 20 秒(4K/1440p 为 10 秒) |
| 音频 | 原生立体声音频 | 原生音频、升级版声码器、音频转视频端点 |
| LoRA 支持 | 暂不支持 | 风格 LoRA、HDR IC-LoRA、角色 LoRA |
| 竖屏模式 | 通过画幅比例控制 | 原生 9:16,使用竖屏数据训练 |
| 本地最低显存 | 8 GB(INT8 量化版) | 实际建议约 12 GB(低显存显卡有 OOM 报告) |
| 许可协议 | MiniMax Community License | 权重采用 Apache 2.0;年营收超过 $10M 的商业使用遵循 LTX Model License |
| 发布时间 | API:2026 年 7 月 31 日;权重:2026 年 8 月 3 日 | 2026 年 3 月 |
两款模型相隔数月先后以开源权重形式发布。LTX 2.3 已经积累了五个月的 LoRA 生态和工作流,而本文撰写时,H3 的权重刚发布八天。
渲染速度与硬件:真正卡住工作流的地方
对部分工作流来说,速度差距足以直接决定模型能不能用;而只看模型体量,反而容易得出错误判断。H3 的确是更大的模型,扩散权重 21 GB、文本编码器 16 GB,但多位用户反馈,它在消费级硬件上的运行稳定性反而优于 LTX 2.3:
“尽管它在技术上比 LTX 2.3 更大,但运行更快,显存问题也更少。我最近又试了一次 2.3,显存占用实在让人烦。” - Reddit 用户 dobomex761604,r/StableDiffusion
不过,稳定不等于快。以下是来自同一 Reddit 对比讨论串的实际耗时:
| 硬件 | 模型 | 时长 / 分辨率 | 实际耗时 |
|---|---|---|---|
| RTX 3060 12 GB | H3(INT8) | 10 秒 / 480p | 约 11 分钟 |
| RTX 3060 12 GB | H3(INT8) | 5 秒 / 约 480p | 约 3-4 分钟 |
| RTX 5090 24 GB | H3(完整版本) | 15 秒 / 720p / 20 steps | 48 分钟 |
| RTX 4080 | LTX 2.3 | 15 秒 / 1080p | 15-20 分钟 |
| RTX 4090 | LTX 2.3 | 5 秒 / 1080p | 25-40 秒 |
| RTX 4090 | Wan 2.2(14B FP8) | 5 秒 / 1080p | 90-120 秒 |
用户 srikantpatnaik给出了一条实用建议:进入 ComfyUI 子图后,把 steps 从 20 降到 10,H3 的生成时间大约可减少 40%,质量损失仍在可接受范围内。目前,单位分辨率对应的生成耗时,是 H3 最明显的短板。
显存表现方面,H3 颇为意外。ComfyUI 自身发行的 INT8 裁剪模型,最低可在 8 GB 显存和 16 GB 系统内存的设备上运行;但根据用户 Aadi_880 的测试记录,此时只能生成较低分辨率,约 0.3-0.4 百万像素、相当于 480-600p,以及 5 秒视频。LTX 2.3 用户则频繁报告 8 GB 显卡出现 OOM,其中一位用户形容其显存体验为“灾难”。
提示词理解与物理表现:H3 优势明显
如果说速度是 LTX 的主场,那么提示词理解就是 H3 拉开距离的项目。在上述Reddit 对比讨论中,多位参与者都更认可 H3 的提示词遵循能力和物理表现:
“MiniMax H3 明显更容易用。无需写复杂、堆满描述的提示词,也能生成相当不错的场景。光这一点就足够让我做决定了。” - Reddit 用户 nvidiot,r/StableDiffusion
“从我的测试来看,Minimax 对物理和提示词的理解非常好。它不会回避动作或血腥等强烈场景。我用 4 句话就能得到结果,而 LTX 需要写 2 段。” - Reddit 用户 Fit_Satisfaction2953
这里的物理差距,主要体现在物体恒常性上。LTX 2.3 经常让物体彼此穿模,或在镜头中途突然消失。H3 使用 33B DiT,并以 Qwen3-VL-32B 第 50 层的隐藏状态作为文本编码器;社区测试者认为,更大的架构是其空间追踪能力更强的重要原因。用户 SX2k7 的评价很直接:“LTX 里东西总会莫名其妙消失,或者直接穿过彼此,这种情况出现得太频繁了。”
同一Reddit 讨论串中的用户还表示,H3 的内容限制比 LTX 和 Wan 更少,可以生成动作场景、血液以及高强度的物理互动,而后两者默认会过滤这类内容。
图生视频的人物一致性
在保持人物身份一致性上,H3 的 Ref2Vid(参考图转视频)是一个突出能力。输入一张角色图片后,社区测试者称,即使角色走出画面再回来,模型依然能在完整片段中维持面部身份一致。
LTX 2.3 的图生视频模式在这次版本中已有改善,例如画面冻结更少、Ken Burns 式伪运动伪影更少;但人物漂移依旧是已知问题:
“对,我试过一段 I2V:角色在镜头外待了 10 秒,最后才回头看镜头,出来的还是同一张脸。LTX 大概会说:‘这谁啊?’” - Reddit 用户 kemb0
如果是产品镜头、角色连续性或品牌内容,且同一张脸必须在 10 秒片段中始终稳定,H3 是开源权重模型中更强的选择。
音频响应与 LoRA 工作流:LTX 的定制优势
这是 LTX 2.3 依然拥有结构性优势、H3 暂时无法匹敌的一环。经过数月发展,LTX 生态已经积累了不少定制工具:
- 风格 LoRA:可针对特定视觉风格进行微调,例如定格动画、手工质感或微缩模型,并按镜头切换使用
- HDR IC-LoRA:直接生成拥有更宽动态范围的 HDR 内容,或将 SDR 素材转为 EXR,接入后期流程
- 音频转视频端点:输入一段音频,由 LTX 生成匹配的画面;适合音乐驱动内容,以及强调声音与动作同步的社交短片
- ComfyUI seedhunter 和 director 工作流:社区构建的多轮流程,先迭代种子寻找最佳输出,再进一步调整构图
- 原生竖屏 9:16:采用竖屏方向数据训练,而不是从横屏裁切而来,对竖屏社交内容尤其关键
- 24/48 FPS 选项:可灵活匹配不同交付规格的帧率要求
相比之下,H3 的工作流还比较基础:带音频的文生视频、图生视频和参考图转视频。它没有 LoRA 训练流程、风格适配器或 HDR 输出。本文撰写时模型发布仅八天,这些差距未来可能会缩小;但对已经建立 LTX LoRA 素材库、并调好 ComfyUI 工作流的创作者而言,切换模型确实存在成本。
用户 l2ddit 很好地概括了这种矛盾:“我很高兴终于能删掉那些根本无法解决问题的 LTX loras。LTX 唯一做得更好的,是非英语语音同步。”
成本对比:本地运行还是调用 API
从许可成本看,本地运行两款模型都免费,但时间才是真正的成本。若通过托管 API 使用,两者的定价差异很大:
| 端点 | LTX 2.3(fal.ai) | MiniMax H3(托管) |
|---|---|---|
| 1080p 文生视频 | $0.06/秒 | API 价格尚未公布 |
| 4K/2K 文生视频 | $0.24/秒(4K) | API 价格尚未公布 |
| 1080p Fast 版本 | $0.04/秒 | N/A |
| 音频转视频 | $0.10/秒 | 包含在视频中 |
| 图生视频 | $0.06-0.24/秒 | 包含在视频中 |
| 扩展 / 重拍 | $0.10/秒 | 暂不可用 |
换算成具体预算:通过 fal.ai 生成一条 5 秒 1080p 的 LTX 2.3 视频,费用是 $0.30;Fast 版本则降至 $0.20。本文撰写时,MiniMax H3 的托管 API 定价尚未公开。本地运行虽然都免费,但在 3060 上等待 H3 渲染 11 分钟,也会带来实际的迭代成本。
LTX 2.3 权重可在 HuggingFace 获取,采用 Apache 2.0;年营收超过 $10M 的公司进行商业嵌入时,则适用 LTX Model License。H3 权重位于 HuggingFace,采用 MiniMax Community License。两者都允许本地离线使用。LTX 2.3 的 API 价格来源于 fal.ai 的模型页面。
实际制作中,镜头该怎么分配
多数创作者其实不必二选一。混合工作流能让两款模型各自发挥所长:
以下镜头交给 H3:
- 需要复杂物理效果,例如碰撞、快速运动和物体交互
- 角色身份需要在长片段中保持稳定,例如产品揭晓或叙事场景
- 希望直接获得原生立体声音频,不想单独走声音制作流程
- 想用更简洁的提示词完成创作,例如 4 句话而不是 2 段文字
- GPU 属于较低配置的 8-12 GB 显存档位,并且能接受更长渲染时间
以下镜头交给 LTX 2.3:
- 需要快速迭代,例如分镜、节奏测试和草稿预览
- 视觉风格依赖定制 LoRA
- 成片是 9:16 竖屏社交内容
- 必须输出 4K 分辨率,H3 最高只有 2K
- 已有音频轨,需要让音频驱动画面并实现同步
- 速度的重要性高于单帧峰值质量
一个实用流程是:先用 LTX Fast 验证走位和节奏,再把确认后的镜头交给 H3,以获得更好的物理、身份一致性和音频。镜头确认后再用超分工具做后期。毕竟 H3 的重渲染成本很高,先把镜头定准更划算。
常见问题
MiniMax H3 比 LTX 2.3 更好吗?
H3 在画质、提示词遵循和身份一致性上更胜一筹;LTX 2.3 则在速度、LoRA 定制和 4K 输出方面领先。应按镜头类型分配,而不是按品牌站队。
MiniMax H3 能在消费级 GPU 上运行吗?
可以。INT8 裁剪模型可在 8 GB VRAM + 16 GB RAM 上运行,生成约 480-600p、5 秒的视频。完整精度的 H3 则更适合 24 GB VRAM。
H3 支持 LoRA 微调吗?
暂不支持。截至 2026 年 8 月 3 日权重发布时,H3 尚未提供 LoRA 工作流。LTX 2.3 支持风格 LoRA、HDR IC-LoRA 和角色 LoRA。
哪款模型的音频更好?
两者都能生成原生音频。H3 可输出立体声,环境细节更丰富;LTX 2.3 升级了声码器,输出更干净,并提供音频转视频端点,可根据输入音频生成画面。
两款模型分别需要多少显存?
H3 INT8:生成 480p 时最低需要 8 GB VRAM + 16 GB RAM。完整精度 H3 更适合 24 GB VRAM。LTX 2.3:实际最低配置约为 12 GB VRAM,8 GB 显卡已有 OOM 报告。