2026년 7월 말, 불과 며칠 차이로 출시된 MiniMax H3와 Flux 3는 곧바로 Reddit 사용자들의 비교 대상이 됐습니다. 같은 프롬프트를 각각 넣어 본 결과, 승자는 용도에 따라 갈렸습니다. 해상도와 오디오 완성도, 멀티모달 레퍼런스 제어는 H3가 앞섰고, 창작 스타일의 폭과 클립 길이, 시네마틱한 연출은 Flux 3가 강했습니다. 전 항목을 압도하는 모델은 없으므로, 어떤 출력 조건이 작업에서 중요한지에 따라 선택이 달라집니다.
두 모델의 차이를 만드는 핵심 사양
MiniMax H3와 Flux 3는 텍스트와 이미지 입력으로 네이티브 오디오 포함 영상을 생성한다는 기본 기능은 같습니다. 하지만 최대 성능을 결정하는 설계 방향은 다릅니다. 수치상 차이는 다음과 같습니다.
| 기능 | MiniMax H3 | Flux 3 Video |
|---|---|---|
| 최대 해상도 | 2K (기본값) | 720p / 1080p |
| 최대 길이 | 15초 | 20초 |
| 오디오 | 네이티브 스테레오 사운드 | 항상 활성화됨 (앰비언스 + 대사) |
| 레퍼런스 입력 | 이미지 최대 9개, 비디오 3개, 오디오 3개 (총 12개 파일 제한) | 시작 프레임 또는 첫 프레임 + 마지막 프레임 |
| 오픈 웨이트 | 예 (HuggingFace) | 아니요 (Early Access API 전용) |
| 모드 | 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 첫/마지막 프레임 | 텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오, 키프레임-투-비디오, 오디오 연장 |
H3는 2K까지 지원하지만 영상 길이는 15초에서 끝납니다. 반면 Flux 3는 20초까지 만들 수 있지만 해상도는 1080p가 상한입니다. 작업 시 알아둘 제약도 있습니다. MiniMax V2 API 문서에 따르면 H3 API에서는 레퍼런스 모드와 첫/마지막 프레임 모드를 함께 사용할 수 없습니다.
10초 영상 하나에 드는 비용
비용은 이용하는 제공업체에 따라 크게 달라집니다. MiniMax는 자사 플랫폼 API를 통해 H3를 직접 제공하며, Flux 3는 Black Forest Labs Early Access와 파트너 플랫폼에서 이용할 수 있습니다.
| 제공업체 | 모델 | 해상도 | 초당 비용 | 10초 클립 비용 |
|---|---|---|---|---|
| MiniMax 플랫폼 | H3 | 2K | $0.13 | $1.30 |
| MiniMax 플랫폼 | H3 | 768p (베타) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | ~100 credits/s | ~1,000 credits |
| LetzAI | Flux 3 | 1080p | ~160 credits/s | ~1,600 credits |
H3를 가장 저렴하게 쓰는 방법은 MiniMax의 직접 API입니다. 2K 기준 초당 $0.13이며, 15초 영상은 $1.95입니다. fal.ai는 초당 $0.26으로 두 배를 청구합니다. 다만 Flux 3의 크레딧과 MiniMax의 달러 가격은 제공업체별 크레딧-달러 환산 비율을 알기 전까지 직접 비교할 수 없습니다.
오디오는 H3가 한 수 위
두 모델에 동일한 프롬프트를 적용해 본 Reddit 사용자는 차이를 이렇게 요약했습니다.
"특히 헤드폰을 쓰고 들어 보면 Minimax H3가 오디오 부문에서 Flux 3를 완전히 압도한다는 점을 알 수 있습니다. 마지막 두 클립에서 특히 뚜렷하지만, 헤드폰을 쓴 뒤 눈을 감고 이 영상을 다시 재생해 오디오 품질 차이만 들어 보세요. Flux 3는 단순히 조금 떨어지는 수준이 아니라, 오디오가 확실히 더 나쁩니다." - GrayingGamer, r/StableDiffusion
H3는 대사, 주변 소음, 물리 효과음을 제대로 된 스테레오 공간에 섞어 네이티브 스테레오 사운드로 생성합니다. Flux 3도 오디오를 항상 포함하며 끄는 옵션은 없습니다. 일부 음성에서는 대사가 더 자연스럽게 들릴 수 있지만, 앰비언스와 환경음 레이어는 눈에 띄게 평면적입니다. 자연 다큐멘터리나 애니메이션 장면에서는 H3의 사운드스케이프가 더 큰 몰입감을 만듭니다.
음성 품질의 우열은 단순하지 않습니다. Flux 3의 바이킹 캐릭터 음성은 일부 청취자에게 더 자연스럽게 들렸고, H3의 카툰 및 다큐멘터리 내레이션은 더 풍부한 표현력으로 평가됐습니다. 어느 쪽도 방송용 수준의 오디오라고 하기는 어렵지만, 환경 사운드 디자인에서는 H3가 분명히 앞섭니다.
장면에 따라 달라지는 영상 품질의 우위
Reddit의 4개 프롬프트 비교에서는 각 모델이 서로 다른 장면에서 우위를 보였습니다.
Flux 3가 잘한 장면: 시네마틱한 바이킹 롱십 장면과 1인칭 드래곤 비행 장면입니다. Flux 3는 더 뛰어난 필름풍 색보정, 움직이는 인물의 설득력, 강한 영화적 분위기를 구현했습니다. 필름 그레인, 렌즈 압축, 골든아워 조명처럼 시대극에 어울리는 미학은 BFL 모델의 강점입니다.
H3가 잘한 장면: 수정 날개를 가진 생명체가 물을 헤치며 걷는 자연 다큐멘터리와 2D 애니메이션풍 해골 소녀 장면입니다. H3는 2K 해상도에서 더 선명한 디테일을 보여 줬고, 생명체 날개 텍스처의 일관성도 더 좋았습니다. 카툰 스타일에서는 캐릭터 애니메이션 표현도 더 풍부했습니다. 다큐멘터리 내레이터의 목소리는 영상 타이밍과 깔끔하게 맞았습니다.
다만 중요한 단서가 있습니다. Reddit 테스트 작성자는 H3의 소비자용 int8 양자화 모델을 Flux 3의 전체 API 버전과 비교했습니다. 댓글 작성자 Pyros-SD-Models는 바이킹 장면에서 bf16 정밀도의 H3가 "OP가 올린 결과보다 훨씬 더 좋다"고 지적했습니다. 즉, 풀 정밀도 오픈 웨이트 모델이라면 양자화 버전에서 보였던 시네마틱한 격차가 줄어들 가능성이 있습니다. 이 결과는 체계적인 벤치마크가 아니라 4개 프롬프트로 진행한 단일 테스트입니다.
물리 표현의 정확도는 두 모델 모두 들쭉날쭉합니다. Reddit 사용자 kaidu는 이렇게 말했습니다. "H3가 아무리 좋아도 글리치와 물리 문제는 여전히 많습니다. 이상하게도 이런 문제는 꽤 무작위로 나타나는 듯합니다. 예를 들어 당신의 사례에서는 물 위를 걷는 드래곤은 아주 사실적으로 보이는데, 노를 젓는 사람들은 정말 형편없습니다." Flux 3도 마찬가지로 예측하기 어려운 실패가 있으며, 바이킹 장면의 보행 애니메이션은 "끔찍하다"는 평가를 받았습니다.
멀티모달 레퍼런스는 H3의 결정적 강점
MiniMax V2 API에 따르면 H3는 한 번의 생성에 이미지 최대 9개, 비디오 클립 3개, 오디오 클립 3개를 레퍼런스로 넣을 수 있으며 전체 파일 수는 12개로 제한됩니다. 자연어로도 지시할 수 있습니다. 예를 들어 "Video 1의 히치콕식 카메라 움직임을 참조하고, Image 2의 캐릭터가 노래하게 하며, 보컬은 Audio 3에 맞춰라"와 같은 요청을 H3 내부에서 처리합니다.
Flux 3는 BFL의 FLUX 3 문서 기준으로 시작 프레임(이미지-투-비디오) 또는 첫 프레임과 마지막 프레임의 조합(키프레임 애니메이션)만 사용할 수 있습니다. 스타일 레퍼런스 이미지, 동작 레퍼런스 비디오, 오디오 레퍼런스를 동시에 입력하는 방식은 지원하지 않습니다.
제품 촬영, 브랜드 일관성이 필요한 광고 콘텐츠, 레퍼런스 연속성이 중요한 캐릭터 중심 장면 같은 상업 작업에서는 이 차이가 결정적입니다. 대신 H3 API에서는 레퍼런스 모드와 첫/마지막 프레임 모드가 상호 배타적입니다. 하나의 API 호출에서 멀티모달 레퍼런스와 양 끝점 키프레임을 함께 섞을 수는 없습니다.
접근 경로와 생태계 비교
| 이용 경로 | MiniMax H3 | Flux 3 |
|---|---|---|
| 공식 API | platform.minimax.io | bfl.ai/models/flux-3 (Early Access) |
| 서드파티 API | fal.ai, Krea, OpenArt, Sogni | LetzAI, Comfy Cloud, fal.ai |
| 오픈 웨이트 | HuggingFace | 아직 없음 (FLUX 3 Dev 출시 예정) |
| 로컬 배포 | ComfyUI (int8/bf16 GGUF) | 아니요 |
H3는 출시 후 며칠 만에 오픈 웨이트를 공개했으며, 현재 HuggingFace에서 이용할 수 있습니다. 개발자들은 양자화된 GGUF 버전을 이용해 ComfyUI에서 로컬로 실행하고 있습니다. Flux 3는 여전히 클로즈드 소스입니다. BFL의 출시 계획에는 오픈 웨이트 버전인 "FLUX 3 Dev"가 예정돼 있지만 출시일은 정해지지 않았습니다.
어떤 모델을 선택해야 할까
| 우선순위 | 추천 모델 | 이유 |
|---|---|---|
| 최대 해상도 | H3 | Flux 3의 1080p 상한보다 높은 네이티브 2K |
| 가장 긴 단일 클립 | Flux 3 | H3의 15초 대비 20초 |
| 오디오 품질 | H3 | 스테레오 사운드와 더 풍부한 앰비언스 |
| 멀티모달 레퍼런스 | H3 | 한 번의 호출에 이미지 9개 + 비디오 + 오디오 |
| 시네마틱 / 레트로 룩 | Flux 3 | 더 뛰어난 색보정과 필름 미학 |
| 공개된 직접 API 가격 | H3 | MiniMax 직접 API에서 2K 기준 $0.13/s, Flux 3 크레딧 가격은 제공업체별로 다름 |
| 비디오-투-비디오 | Flux 3 | H3는 동일한 엔드포인트에서 V2V를 제공하지 않음 |
| 오픈 웨이트 / 로컬 실행 | H3 | 웨이트를 지금 이용 가능하며 Flux 3는 클로즈드 상태 |
| 상업용 제품 영상 | H3 | 텍스트/브랜드 렌더링, 레퍼런스 일관성, 2K 디테일 |
| 창의적 영상 제작 | Flux 3 | 프롬프트 기반 아트 디렉션과 스타일 범위가 더 뛰어남 |
정리하면 정밀도, 해상도, 레퍼런스 충실도, 공개된 직접 API 가격이 중요하다면 H3가 맞습니다. 기술 사양보다 창작 방향이 우선이고, 더 긴 테이크와 스타일화된 미학, 비디오-투-비디오 워크플로가 필요하다면 Flux 3를 고르는 편이 낫습니다.
제한 시간을 넘어 클립을 이어 붙일 수 있나?
가능하지만 방식은 다릅니다. H3의 첫 프레임+마지막 프레임 모드에서는 한 클립의 마지막 프레임을 다음 클립의 시작 프레임으로 쓸 수 있습니다. 이를 활용하면 15초짜리 클립 두 개를 이어 약 30초 시퀀스로 확장할 수 있습니다. 공유 키프레임 덕분에 구도와 캐릭터 정체성을 맞추기 쉽습니다. Flux 3는 BFL이 설명한 "agentic chaining"을 지원합니다. 시각 레퍼런스를 사용해 장면 간 캐릭터 일관성을 유지하면서 여러 클립을 멀티샷 시퀀스로 연결하는 방식입니다. 두 모델 모두 명시된 최대 길이를 한 번의 생성으로 넘길 수는 없지만, 계획적으로 이어 붙이면 더 긴 영상으로 확장할 수 있습니다.
FAQ
MiniMax H3를 로컬에서 실행할 수 있나?
가능합니다. MiniMax는 출시 직후 HuggingFace에 H3 모델 웨이트를 공개했습니다. ComfyUI용 커뮤니티 구성은 int8 및 bf16 GGUF 형식으로 제공됩니다. 풀 정밀도 모델은 상당한 VRAM이 필요하지만, 양자화 버전은 소비자용 GPU에서도 실행할 수 있습니다.
영상 속 텍스트 렌더링은 어느 모델이 더 잘하나?
MiniMax의 공식 테스트에 따르면 H3는 생성 영상 프레임 안의 텍스트와 브랜드 로고 렌더링에서 더 강한 성능을 보입니다. 제품명이나 UI 텍스트가 결과물에 정확히 표시돼야 하는 광고 작업에서 특히 중요한 차이입니다.