AIREITER

MiniMax H3 vs LTX 2.3: 오픈 웨이트 영상 모델 비교

마지막 업데이트: 2026-08-07 03:53:01

12 GB VRAM의 RTX 3060에서 다음 영상을 MiniMax H3로 돌릴지, LTX 2.3로 보낼지 고민하고 있다면 모델 스펙만 봐서는 답이 나오지 않는다. 둘 다 네이티브 오디오를 지원하는 오픈 웨이트 영상 모델이고 ComfyUI에서 로컬 실행할 수 있다. 다만 한쪽은 5초 1080p 클립을 40초 이내에 만들 수 있는 반면, 다른 한쪽은 10초 480p에 11분이 걸릴 수 있다. 그 느린 모델의 물리 표현은 Reddit 커뮤니티에서 "비교가 안 될 정도"라는 평가도 나온다. 중요한 건 어느 모델이 절대적으로 낫냐가 아니라, 지금 만들 샷과 보유 하드웨어, 납기 일정에 어느 쪽이 맞느냐다.

MiniMax H3와 LTX 2.3 핵심 사양 비교

항목MiniMax H3LTX 2.3
아키텍처33B DiT + Qwen3-VL-32B encoderDiT 기반, 신규 VAE
최대 해상도2K4K
최대 길이15초20초(4K/1440p에서는 10초)
오디오네이티브 스테레오 사운드네이티브 오디오, 개선된 보코더, audio-to-video 엔드포인트
LoRA 지원아직 미지원Style LoRA, HDR IC-LoRA, 캐릭터 LoRA
세로 모드화면비 제어로 지원네이티브 9:16, 세로형 데이터 학습
최소 VRAM(로컬)8 GB(INT8 양자화)실사용 약 12 GB(저사양 카드 OOM 보고)
라이선스MiniMax Community LicenseApache 2.0 weights; 연 매출 $10M 초과 상업 용도는 LTX Model License
출시API 2026년 7월 31일; weights 2026년 8월 3일2026년 3월

두 모델은 수개월 간격으로 오픈 웨이트 형태로 등장했다. LTX 2.3는 성숙한 LoRA 파이프라인을 구축할 수 있었던 5개월의 선행 기간이 있고, H3의 weights는 작성 시점 기준으로 출시 8일 차다.

렌더링 속도와 하드웨어: 실제 병목은 여기다

일부 파이프라인에서는 속도 차이가 도입 자체를 어렵게 만든다. 흥미로운 점은 단순한 모델 크기로는 결과를 예측하기 어렵다는 것이다. H3는 기술적으로 더 큰 모델이다. diffusion weights는 21 GB, 텍스트 encoder는 16 GB다. 그런데도 여러 사용자는 소비자용 하드웨어에서 H3가 LTX 2.3보다 더 안정적으로 동작한다고 보고한다.

"기술적으로는 LTX 2.3보다 큰데도 더 빠르게 돌고 메모리 문제도 적습니다. 최근에 2.3을 다시 써 봤는데 메모리 사용량 때문에 짜증이 났어요." - Reddit 사용자 dobomex761604, r/StableDiffusion

하지만 안정성이 곧 속도는 아니다. 같은 Reddit 비교 스레드에 올라온 실제 경과 시간은 다음과 같다.

하드웨어모델길이 / 해상도실제 소요 시간
RTX 3060 12 GBH3 (INT8)10초 / 480p약 11분
RTX 3060 12 GBH3 (INT8)5초 / 약 480p약 3~4분
RTX 5090 24 GBH3 (full)15초 / 720p / 20 steps48분
RTX 4080LTX 2.315초 / 1080p15~20분
RTX 4090LTX 2.35초 / 1080p25~40초
RTX 4090Wan 2.2 (14B FP8)5초 / 1080p90~120초

사용자 srikantpatnaik의 실용적인 팁도 있다. ComfyUI 서브그래프에 들어가 steps를 20에서 10으로 낮추면, 품질 저하를 감당 가능한 수준으로 유지하면서 H3 생성 시간을 약 40% 줄일 수 있다. 현재 H3의 가장 큰 약점은 해상도와 길이에 비례해 늘어나는 렌더 시간이다.

VRAM 요구량에서는 H3가 의외의 모습을 보인다. ComfyUI가 직접 배포하는 INT8-pruned 모델은 16 GB 시스템 RAM과 8 GB VRAM만으로도 동작한다. 다만 사용자 Aadi_880의 테스트 노트에 따르면 해상도는 0.3~0.4메가픽셀, 대략 480~600p 수준으로 제한되고 클립 길이도 5초다. 반면 LTX 2.3는 8 GB 카드에서 OOM 오류가 잦다는 보고가 있으며, 한 사용자는 메모리 측면의 경험을 "재앙"이라고 표현했다.

프롬프트 이해와 물리 표현은 H3가 앞선다

속도는 LTX의 영역이라면, 프롬프트 이해력은 H3가 확실히 우위에 서는 분야다. 앞서 언급한 Reddit 비교 스레드의 여러 참여자는 프롬프트 충실도와 물리 표현에서 H3를 더 높게 평가했다.

"MiniMax H3는 훨씬 쓰기 쉽습니다. 복잡하고 과도하게 묘사적인 프롬프트를 작성하지 않아도 꽤 괜찮은 장면을 만들 수 있어요. 저에게는 그것만으로도 선택이 끝났습니다." - Reddit 사용자 nvidiot, r/StableDiffusion

"테스트해 보니 Minimax는 물리와 프롬프트 지시를 아주 잘 이해합니다. 액션이나 피처럼 강도가 있는 장면도 피하지 않아요. LTX에서는 두 문단이 필요했던 결과를 4문장으로 얻을 수 있었습니다." - Reddit 사용자 Fit_Satisfaction2953

물리 표현의 차이는 특히 객체 지속성에서 두드러진다. LTX 2.3에서는 물체가 서로를 통과하거나 장면 중간에 사라지는 일이 자주 발생한다. H3는 33B DiT와 Qwen3-VL-32B의 50번째 레이어 hidden states를 텍스트 encoder로 사용하며, 커뮤니티 테스터들은 더 큰 이 아키텍처가 강한 공간 추적 성능에 기여한다고 본다. 사용자 SX2k7은 "LTX에서는 사물이 이유 없이 사라지거나 서로를 통과해 움직이는 일이 너무 잦다"고 말했다.

같은 Reddit 스레드의 사용자들은 H3가 LTX와 Wan보다 검열이 덜하다고도 평가한다. 다른 모델이 기본적으로 필터링하는 액션 장면, 피, 격렬한 신체 움직임을 허용한다는 것이다.

이미지-투-비디오에서 더 안정적인 인물 유지

H3의 Ref2Vid(reference-to-video)는 인물 정체성 유지에서 눈에 띄는 기능이다. 캐릭터 이미지를 입력하면, 인물이 화면 밖으로 나갔다가 다시 돌아오는 경우에도 클립 전체에서 얼굴 정체성이 유지된다는 커뮤니티 테스트 결과가 나온다.

LTX 2.3의 image-to-video는 이번 버전에서 개선됐다. 화면이 멈추거나 Ken Burns 스타일의 가짜 움직임이 생기는 현상이 줄었다. 하지만 인물 정체성이 흐트러지는 문제는 여전히 알려진 약점이다.

"맞아요. 캐릭터가 샷에서 10초 동안 사라졌다가 마지막에 다시 돌아보는 I2V를 해 봤는데, 얼굴이 완전히 동일했어요. LTX라면 '누구세요?' 할 겁니다." - Reddit 사용자 kemb0

제품 샷, 캐릭터 일관성, 동일 인물이 10초 클립 내내 유지되어야 하는 브랜드 작업이라면 오픈 웨이트 모델 중 H3의 Ref2Vid가 더 강한 선택지다.

LoRA와 오디오 반응형 워크플로는 LTX의 강점

이 분야에서는 H3가 아직 따라잡지 못하는 구조적 우위가 LTX 2.3에 있다. LTX 생태계는 수개월 동안 커스텀 도구를 축적해 왔다.

  • Style LoRA: 스톱모션, 핸드메이드, 미니어처 등 특정 시각 스타일로 모델을 미세 조정하고 샷마다 교체할 수 있다
  • HDR IC-LoRA: 확장된 다이내믹 레인지의 HDR 영상을 직접 생성하거나, SDR 영상을 마무리 파이프라인용 EXR로 변환할 수 있다
  • Audio-to-video 엔드포인트: 오디오 클립을 입력하면 LTX가 이에 맞는 영상을 생성한다. 사운드와 움직임의 싱크가 중요한 음악 중심 콘텐츠나 소셜 클립에 유용하다
  • ComfyUI seedhunter 및 director 워크플로: 최적의 출력을 찾기 위해 seed를 반복 탐색한 뒤 구도를 다듬는 커뮤니티 제작 멀티패스 파이프라인
  • 네이티브 세로형 9:16: 가로 영상을 크롭한 것이 아니라 세로 방향 데이터로 학습했다. 세로형 소셜 콘텐츠에 중요하다
  • 24/48 FPS 옵션: 납품 규격에 맞출 수 있는 프레임레이트 유연성

이에 비해 H3 워크플로는 단순하다. 오디오를 포함한 text-to-video, image-to-video, reference-to-video를 제공하지만 LoRA 학습 파이프라인, 스타일 어댑터, HDR 출력은 없다. 작성 시점에 모델 출시 8일 차라는 점을 감안하면 이 격차는 줄어들 수 있다. 하지만 이미 LTX LoRA 라이브러리와 튜닝된 ComfyUI 그래프를 갖춘 크리에이터에게 지금 모델을 바꾸는 일은 분명한 전환 비용이다.

사용자 l2ddit은 이 긴장 관계를 이렇게 요약했다. "이제 문제를 전혀 해결하지 못했던 LTX lora들을 모두 지울 수 있어서 정말 기쁩니다. LTX가 더 잘했던 건 영어 이외 언어의 음성 싱크뿐이었어요."

비용 비교: 로컬 실행과 API

라이선스 관점에서 두 모델 모두 로컬 실행은 무료다. 다만 실제 비용은 렌더링에 드는 시간이다. 호스팅 API를 이용하면 가격 차이는 상당하다.

엔드포인트LTX 2.3 (fal.ai)MiniMax H3 (hosted)
Text-to-video 1080p$0.06/sAPI 가격 미공개
Text-to-video 4K/2K$0.24/s (4K)API 가격 미공개
Fast variant 1080p$0.04/sN/A
Audio-to-video$0.10/s영상에 포함
Image-to-video$0.06-0.24/s영상에 포함
Extend / Retake$0.10/s아직 제공되지 않음

구체적으로 계산하면 fal.ai에서 LTX 2.3로 5초 1080p 클립을 만드는 비용은 $0.30이다. Fast variant를 사용하면 $0.20까지 내려간다. MiniMax H3의 hosted API 가격은 작성 시점까지 공개되지 않았다. 로컬에서는 둘 다 무료로 실행할 수 있지만, RTX 3060에서 H3 한 번 렌더링에 11분이 걸리는 환경이라면 반복 작업 비용은 무시하기 어렵다.

LTX 2.3 weights는 HuggingFace에서 Apache 2.0으로 제공된다. 연 매출 $10M을 넘는 기업의 상업적 임베딩에는 LTX Model License가 적용된다. H3 weights는 HuggingFace에서 MiniMax Community License로 제공된다. 두 모델 모두 로컬 오프라인 사용을 허용한다. LTX 2.3 API 가격 출처는 fal.ai의 모델 페이지다.

실전 제작에서는 샷별로 나눠 쓰면 된다

대부분의 크리에이터가 둘 중 하나만 선택할 필요는 없다. 하이브리드 파이프라인으로 각 모델의 강점을 활용하는 편이 낫다.

다음과 같은 샷은 H3로 보낸다:

  • 충돌, 빠른 움직임, 물체 간 상호작용처럼 복잡한 물리 표현이 필요한 경우
  • 제품 공개나 서사 장면처럼 긴 클립 동안 캐릭터 정체성을 유지해야 하는 경우
  • 별도 사운드 패스 없이 네이티브 스테레오 오디오가 필요한 경우
  • 간결한 프롬프트가 중요한 경우(4문장 대 2문단)
  • GPU가 8~12 GB VRAM 수준이지만 더 긴 렌더 시간을 감수할 수 있는 경우

다음과 같은 샷은 LTX 2.3로 보낸다:

  • 스토리보드, 타이밍 테스트, 초안 미리보기처럼 빠른 반복이 필요한 경우
  • 커스텀 LoRA가 시각 스타일을 결정하는 경우
  • 세로형 9:16 소셜 콘텐츠가 납품물인 경우
  • 4K 해상도가 필요한 경우(H3는 2K가 최대)
  • 기존 오디오 트랙이 영상을 이끌어야 하는 audio-to-video 싱크가 필요한 경우
  • 프레임당 최고 품질보다 속도가 중요한 경우

실용적인 흐름은 이렇다. LTX Fast로 블로킹과 타이밍을 먼저 검증하고, 승인된 샷을 H3에 넣어 물리 표현, 정체성, 오디오까지 포함한 최종 렌더를 만든다. 업스케일러 처리는 샷이 승인된 뒤에만 적용한다. H3는 다시 돌리는 데 드는 시간이 크므로, 먼저 샷을 정확히 잡아 두는 편이 낫다.

자주 묻는 질문

MiniMax H3가 LTX 2.3보다 더 좋은가?

품질, 프롬프트 충실도, 인물 정체성 유지에서는 H3가 우세하다. 속도, LoRA 커스터마이징, 4K 출력은 LTX 2.3의 강점이다. 브랜드가 아니라 샷 유형에 따라 선택하는 것이 맞다.

MiniMax H3는 소비자용 GPU에서도 실행할 수 있나?

가능하다. INT8-pruned 모델은 8 GB VRAM + 16 GB RAM 환경에서 약 480~600p, 5초 길이로 실행된다. full-precision H3는 24 GB VRAM에서 더 유리하다.

H3는 LoRA 미세 조정을 지원하나?

아직 지원하지 않는다. 2026년 8월 3일 weights 출시 기준으로 H3에는 LoRA 파이프라인이 없다. LTX 2.3는 Style LoRA, HDR IC-LoRA, 캐릭터 LoRA를 지원한다.

오디오 품질은 어느 모델이 더 좋은가?

두 모델 모두 네이티브 오디오를 생성한다. H3는 더 풍부한 주변 디테일의 스테레오 사운드를 제공한다. LTX 2.3는 더 깨끗한 출력을 위해 보코더를 개선했으며, 입력 오디오 클립에서 영상을 생성하는 audio-to-video 엔드포인트도 제공한다.

모델별로 필요한 VRAM은 얼마인가?

H3 INT8은 480p 기준 최소 8 GB VRAM + 16 GB RAM이 필요하다. full-precision H3는 24 GB VRAM에서 더 유리하다. LTX 2.3의 실사용 최소치는 약 12 GB VRAM이며, 8 GB 카드에서는 OOM 보고가 있다.