AIREITER

MiniMax H3 vs Flux 3 Video:2026 正面对比

最后更新: 2026-08-07 03:18:01

两款模型在 2026 年 7 月下旬前后脚发布后,Reddit 用户很快用同一批提示词让 MiniMax H3 和 Flux 3 正面对决。结论并不简单:H3 在分辨率、音频还原和多模态参考控制上更强;Flux 3 则在创作自由度、片段时长与电影化风格上占优。没有哪一款能横扫所有项目,关键还是看你的工作流最看重哪些输出指标。

MiniMax H3 官方发布页面,展示其支持原生立体声音频的 2K 视频能力

真正拉开差距的规格

MiniMax H3 和 Flux 3 的基础能力颇为接近:两者都能根据文本和图片生成带原生音频的视频。但它们的技术上限由不同设计取向决定,具体差异如下:

特性MiniMax H3Flux 3 Video
最高分辨率2K(默认)720p / 1080p
最长时长15 秒20 秒
音频原生立体声始终开启(环境音 + 对话)
参考输入最多 9 张图片、3 段视频、3 段音频(最多 12 个文件)起始帧,或首帧 + 尾帧
开放权重是(HuggingFace)否(仅限 Early Access API)
模式文生视频、图生视频、参考生视频、首尾帧文生视频、图生视频、视频生视频、关键帧生视频、音频延续

H3 默认可输出 2K,但单段最长为 15 秒;Flux 3 可生成 20 秒片段,分辨率上限则是 1080p。还有一个直接影响工作流的限制:根据 MiniMax V2 API 文档,H3 的参考模式与首尾帧模式不能同时使用。

Black Forest Labs 的 FLUX 3 官方博客页面,展示多模态视频能力

生成 10 秒视频要花多少钱

实际费用会因接入渠道而明显不同。MiniMax 通过自家平台 API 直接提供 H3;Flux 3 则可通过 Black Forest Labs Early Access 及合作平台使用。

提供方模型分辨率每秒价格10 秒片段价格
MiniMax platformH32K$0.13$1.30
MiniMax platformH3768p(beta)$0.09$0.90
fal.aiH32K$0.26$2.60
LetzAIFlux 3720p约 100 credits/秒约 1,000 credits
LetzAIFlux 31080p约 160 credits/秒约 1,600 credits

若直接调用 MiniMax API,H3 的 2K 价格为 $0.13/秒,是目前最便宜的路径:15 秒视频为 $1.95。fal.ai 的收费翻倍,为 $0.26/秒。由于各家 credits 与美元的兑换关系并不明确,Flux 3 的积分价格无法直接与 MiniMax 的美元计价横向比较。

音频:H3 的领先最明显

一位同时用两款模型跑过相同提示词的 Reddit 用户如此评价:

“不过我发现,尤其是戴上耳机后,Minimax H3 在音频方面完全碾压 Flux 3。最后两个片段尤其明显。如果你戴着耳机,不妨闭上眼重新播放视频,只听音频质量的差别。Flux 3 不只是略差,而是明显更差。”—— GrayingGamer,r/StableDiffusion

H3 生成的是原生立体声:对白、环境噪声和物理效果会被混入相对完整的立体声场。Flux 3 也始终带有音频,且无法关闭;在某些声线中,它的对白听起来可能更自然。但其环境音和场景氛围层次明显更平。对于自然纪录片或动画场景,H3 的声场更有沉浸感,Flux 3 目前难以匹敌。

人声质量的差距并非绝对。部分听众认为 Flux 3 的维京角色声音更自然,而 H3 的卡通角色与纪录片旁白更具表现力。两款模型的音频都还谈不上广播级成品,但在环境声设计上,H3 的优势相当明确。

画质表现取决于场景

在一组包含 四条提示词的 Reddit 对比中,两款模型分别赢下了不同题材:

Flux 3 更胜一筹:电影感的维京长船场景,以及第一人称骑龙飞行画面。Flux 3 的电影级调色更好,运动中的人物更可信,整体镜头语言也更强。年代片的审美质感——胶片颗粒、镜头压缩感和黄金时刻光线——正是 BFL 模型的强项。

H3 更有优势:一只水中涉行的水晶翅膀生物自然纪录片,以及一段 2D 动画风格的骷髅女孩画面。H3 的 2K 输出带来更锐利的细节,生物翅膀的纹理一致性更好,卡通风格中的角色动画也更有表现力。纪录片旁白与画面节奏的同步也很干净。

这里有一个重要前提:Reddit 测试者拿 H3 面向消费者的 int8 量化模型,与 Flux 3 的完整 API 版本进行比较。评论者 Pyros-SD-Models 指出,在维京场景中,完整 bf16 精度的 H3“比 OP 展示的效果好得多”。这意味着,开放权重模型在完整精度下,可能会缩小量化版本所显示出的电影感差距。需要强调的是,这只是单次四条提示词测试,并非系统性基准评测。

两款模型的物理准确性依然不稳定。Reddit 用户 kaidu 表示:“H3 虽然不错,但仍有很多瑕疵和物理问题。而且奇怪的是,它们似乎会很随机地出现。就像你的示例中:龙在水面上行走看起来非常真实,但划船的人看起来却糟糕透顶。”Flux 3 也会出现类似的随机失误——其维京场景中的行走动作被形容为“很糟糕”。

多模态参考:H3 的决定性优势

根据 MiniMax V2 API,H3 单次生成最多可接受 9 张图片、3 段视频和 3 段音频作为参考,但总文件数上限为 12 个。你可以直接用自然语言下达指令,例如:“参考 Video 1 中的 Hitchcock 镜头运动,让 Image 2 中的角色演唱,歌声与 Audio 3 一致。”H3 会在内部完成这些跨素材关联。

根据 BFL 的 FLUX 3 文档,Flux 3 仅支持一张起始帧图片用于图生视频,或一组首帧加尾帧用于关键帧动画。你无法同时输入一张风格参考图、一段动作参考视频和一段音频参考。

对于商业工作流而言——例如产品展示、保持品牌一致性的广告内容,或要求角色参考连续性的场景——这是决定性的功能差距。当然,H3 也有取舍:其 API 中的参考模式和首尾帧模式彼此互斥,无法在同一次 API 调用里同时使用多模态参考与端点关键帧。

接入渠道与生态

接入方式MiniMax H3Flux 3
官方 APIplatform.minimax.iobfl.ai/models/flux-3(Early Access)
第三方 APIfal.ai、Krea、OpenArt、SogniLetzAI、Comfy Cloud、fal.ai
开放权重HuggingFace暂未开放(计划推出 FLUX 3 Dev)
本地部署ComfyUI(int8/bf16 GGUF)不支持

H3 在发布后的数日内便提供了开放权重,目前可从 HuggingFace 获取。开发者已经能通过 ComfyUI 运行其量化 GGUF 版本。Flux 3 仍是闭源模型;BFL 的发布计划提到未来将推出开放权重版本“FLUX 3 Dev”,但尚未给出发布日期。

该选哪一款模型

你的优先需求推荐选择理由
最高分辨率H3原生 2K,Flux 3 上限为 1080p
单条视频最长时长Flux 320 秒,对比 H3 的 15 秒
音频质量H3立体声与更丰富的环境音
多模态参考H3单次可使用 9 张图片 + 视频 + 音频
电影感 / 复古风格Flux 3调色和胶片美学更出色
已公布的直连 API 价格H3MiniMax 直连 2K 为 $0.13/秒;Flux 3 的积分价格因提供方而异
视频生视频Flux 3H3 无法通过同一端点提供 V2V
开放权重 / 本地运行H3权重现已可用;Flux 3 仍为闭源
商业产品视频H3文字与品牌元素渲染、参考一致性和 2K 细节更好
创意影视制作Flux 3基于提示词的艺术指导与风格范围更强

整体规律很清晰:若项目看重精确控制、分辨率、参考还原,或已公布的直连 API 价格,选 H3;若创意方向比技术规格更重要,且需要更长镜头、风格化美学或视频生视频工作流,Flux 3 更合适。

能否突破单段时长上限,串成长视频?

可以,但两者的方法不同。H3 的首帧加尾帧模式,可以将前一段视频的最后一帧作为下一段的起始帧,把两条 15 秒片段衔接为约 30 秒的序列。共享关键帧有助于保持构图和角色身份一致。Flux 3 支持 BFL 所称的“agentic chaining”:通过视觉参考把独立片段连接成多镜头序列,在不同场景中维持角色一致性。两者都无法单次生成超过标称上限的视频,但都能通过提前规划实现延展。

常见问题

MiniMax H3 可以本地运行吗?

可以。MiniMax 在发布后不久便将 H3 模型权重发布到 HuggingFace。社区已经提供适用于 ComfyUI 的 int8 和 bf16 GGUF 配置。完整精度模型需要大量显存,但量化版本可以在消费级 GPU 上运行。

哪款模型的视频文字渲染更好?

根据 MiniMax 的官方测试,H3 在生成视频帧中的文字和品牌 Logo 渲染方面表现更强。这对广告工作流尤其重要,因为产品名称或 UI 文字需要在最终输出中正确呈现。