两款模型在 2026 年 7 月下旬前后脚发布后,Reddit 用户很快用同一批提示词让 MiniMax H3 和 Flux 3 正面对决。结论并不简单:H3 在分辨率、音频还原和多模态参考控制上更强;Flux 3 则在创作自由度、片段时长与电影化风格上占优。没有哪一款能横扫所有项目,关键还是看你的工作流最看重哪些输出指标。
真正拉开差距的规格
MiniMax H3 和 Flux 3 的基础能力颇为接近:两者都能根据文本和图片生成带原生音频的视频。但它们的技术上限由不同设计取向决定,具体差异如下:
| 特性 | MiniMax H3 | Flux 3 Video |
|---|---|---|
| 最高分辨率 | 2K(默认) | 720p / 1080p |
| 最长时长 | 15 秒 | 20 秒 |
| 音频 | 原生立体声 | 始终开启(环境音 + 对话) |
| 参考输入 | 最多 9 张图片、3 段视频、3 段音频(最多 12 个文件) | 起始帧,或首帧 + 尾帧 |
| 开放权重 | 是(HuggingFace) | 否(仅限 Early Access API) |
| 模式 | 文生视频、图生视频、参考生视频、首尾帧 | 文生视频、图生视频、视频生视频、关键帧生视频、音频延续 |
H3 默认可输出 2K,但单段最长为 15 秒;Flux 3 可生成 20 秒片段,分辨率上限则是 1080p。还有一个直接影响工作流的限制:根据 MiniMax V2 API 文档,H3 的参考模式与首尾帧模式不能同时使用。
生成 10 秒视频要花多少钱
实际费用会因接入渠道而明显不同。MiniMax 通过自家平台 API 直接提供 H3;Flux 3 则可通过 Black Forest Labs Early Access 及合作平台使用。
| 提供方 | 模型 | 分辨率 | 每秒价格 | 10 秒片段价格 |
|---|---|---|---|---|
| MiniMax platform | H3 | 2K | $0.13 | $1.30 |
| MiniMax platform | H3 | 768p(beta) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | 约 100 credits/秒 | 约 1,000 credits |
| LetzAI | Flux 3 | 1080p | 约 160 credits/秒 | 约 1,600 credits |
若直接调用 MiniMax API,H3 的 2K 价格为 $0.13/秒,是目前最便宜的路径:15 秒视频为 $1.95。fal.ai 的收费翻倍,为 $0.26/秒。由于各家 credits 与美元的兑换关系并不明确,Flux 3 的积分价格无法直接与 MiniMax 的美元计价横向比较。
音频:H3 的领先最明显
一位同时用两款模型跑过相同提示词的 Reddit 用户如此评价:
“不过我发现,尤其是戴上耳机后,Minimax H3 在音频方面完全碾压 Flux 3。最后两个片段尤其明显。如果你戴着耳机,不妨闭上眼重新播放视频,只听音频质量的差别。Flux 3 不只是略差,而是明显更差。”—— GrayingGamer,r/StableDiffusion
H3 生成的是原生立体声:对白、环境噪声和物理效果会被混入相对完整的立体声场。Flux 3 也始终带有音频,且无法关闭;在某些声线中,它的对白听起来可能更自然。但其环境音和场景氛围层次明显更平。对于自然纪录片或动画场景,H3 的声场更有沉浸感,Flux 3 目前难以匹敌。
人声质量的差距并非绝对。部分听众认为 Flux 3 的维京角色声音更自然,而 H3 的卡通角色与纪录片旁白更具表现力。两款模型的音频都还谈不上广播级成品,但在环境声设计上,H3 的优势相当明确。
画质表现取决于场景
在一组包含 四条提示词的 Reddit 对比中,两款模型分别赢下了不同题材:
Flux 3 更胜一筹:电影感的维京长船场景,以及第一人称骑龙飞行画面。Flux 3 的电影级调色更好,运动中的人物更可信,整体镜头语言也更强。年代片的审美质感——胶片颗粒、镜头压缩感和黄金时刻光线——正是 BFL 模型的强项。
H3 更有优势:一只水中涉行的水晶翅膀生物自然纪录片,以及一段 2D 动画风格的骷髅女孩画面。H3 的 2K 输出带来更锐利的细节,生物翅膀的纹理一致性更好,卡通风格中的角色动画也更有表现力。纪录片旁白与画面节奏的同步也很干净。
这里有一个重要前提:Reddit 测试者拿 H3 面向消费者的 int8 量化模型,与 Flux 3 的完整 API 版本进行比较。评论者 Pyros-SD-Models 指出,在维京场景中,完整 bf16 精度的 H3“比 OP 展示的效果好得多”。这意味着,开放权重模型在完整精度下,可能会缩小量化版本所显示出的电影感差距。需要强调的是,这只是单次四条提示词测试,并非系统性基准评测。
两款模型的物理准确性依然不稳定。Reddit 用户 kaidu 表示:“H3 虽然不错,但仍有很多瑕疵和物理问题。而且奇怪的是,它们似乎会很随机地出现。就像你的示例中:龙在水面上行走看起来非常真实,但划船的人看起来却糟糕透顶。”Flux 3 也会出现类似的随机失误——其维京场景中的行走动作被形容为“很糟糕”。
多模态参考:H3 的决定性优势
根据 MiniMax V2 API,H3 单次生成最多可接受 9 张图片、3 段视频和 3 段音频作为参考,但总文件数上限为 12 个。你可以直接用自然语言下达指令,例如:“参考 Video 1 中的 Hitchcock 镜头运动,让 Image 2 中的角色演唱,歌声与 Audio 3 一致。”H3 会在内部完成这些跨素材关联。
根据 BFL 的 FLUX 3 文档,Flux 3 仅支持一张起始帧图片用于图生视频,或一组首帧加尾帧用于关键帧动画。你无法同时输入一张风格参考图、一段动作参考视频和一段音频参考。
对于商业工作流而言——例如产品展示、保持品牌一致性的广告内容,或要求角色参考连续性的场景——这是决定性的功能差距。当然,H3 也有取舍:其 API 中的参考模式和首尾帧模式彼此互斥,无法在同一次 API 调用里同时使用多模态参考与端点关键帧。
接入渠道与生态
| 接入方式 | MiniMax H3 | Flux 3 |
|---|---|---|
| 官方 API | platform.minimax.io | bfl.ai/models/flux-3(Early Access) |
| 第三方 API | fal.ai、Krea、OpenArt、Sogni | LetzAI、Comfy Cloud、fal.ai |
| 开放权重 | HuggingFace | 暂未开放(计划推出 FLUX 3 Dev) |
| 本地部署 | ComfyUI(int8/bf16 GGUF) | 不支持 |
H3 在发布后的数日内便提供了开放权重,目前可从 HuggingFace 获取。开发者已经能通过 ComfyUI 运行其量化 GGUF 版本。Flux 3 仍是闭源模型;BFL 的发布计划提到未来将推出开放权重版本“FLUX 3 Dev”,但尚未给出发布日期。
该选哪一款模型
| 你的优先需求 | 推荐选择 | 理由 |
|---|---|---|
| 最高分辨率 | H3 | 原生 2K,Flux 3 上限为 1080p |
| 单条视频最长时长 | Flux 3 | 20 秒,对比 H3 的 15 秒 |
| 音频质量 | H3 | 立体声与更丰富的环境音 |
| 多模态参考 | H3 | 单次可使用 9 张图片 + 视频 + 音频 |
| 电影感 / 复古风格 | Flux 3 | 调色和胶片美学更出色 |
| 已公布的直连 API 价格 | H3 | MiniMax 直连 2K 为 $0.13/秒;Flux 3 的积分价格因提供方而异 |
| 视频生视频 | Flux 3 | H3 无法通过同一端点提供 V2V |
| 开放权重 / 本地运行 | H3 | 权重现已可用;Flux 3 仍为闭源 |
| 商业产品视频 | H3 | 文字与品牌元素渲染、参考一致性和 2K 细节更好 |
| 创意影视制作 | Flux 3 | 基于提示词的艺术指导与风格范围更强 |
整体规律很清晰:若项目看重精确控制、分辨率、参考还原,或已公布的直连 API 价格,选 H3;若创意方向比技术规格更重要,且需要更长镜头、风格化美学或视频生视频工作流,Flux 3 更合适。
能否突破单段时长上限,串成长视频?
可以,但两者的方法不同。H3 的首帧加尾帧模式,可以将前一段视频的最后一帧作为下一段的起始帧,把两条 15 秒片段衔接为约 30 秒的序列。共享关键帧有助于保持构图和角色身份一致。Flux 3 支持 BFL 所称的“agentic chaining”:通过视觉参考把独立片段连接成多镜头序列,在不同场景中维持角色一致性。两者都无法单次生成超过标称上限的视频,但都能通过提前规划实现延展。
常见问题
MiniMax H3 可以本地运行吗?
可以。MiniMax 在发布后不久便将 H3 模型权重发布到 HuggingFace。社区已经提供适用于 ComfyUI 的 int8 和 bf16 GGUF 配置。完整精度模型需要大量显存,但量化版本可以在消费级 GPU 上运行。
哪款模型的视频文字渲染更好?
根据 MiniMax 的官方测试,H3 在生成视频帧中的文字和品牌 Logo 渲染方面表现更强。这对广告工作流尤其重要,因为产品名称或 UI 文字需要在最终输出中正确呈现。