AIREITER

MiniMax H3 и LTX 2.3: сравнение открытых видеомоделей

Последнее обновление: 2026-08-07 03:54:31

RTX 3060 с 12 ГБ VRAM, очередь на рендер и выбор между MiniMax H3 и LTX 2.3: на практике это не спор о том, какая модель «лучше». Обе модели с открытыми весами генерируют видео со звуком и запускаются локально через ComfyUI. Но LTX 2.3 способна выдать 5 секунд в 1080p менее чем за 40 секунд, тогда как H3 на той же категории железа может потратить 11 минут на 10 секунд в 480p — зато её физику сообщество Reddit считает несравнимо убедительнее. Выбирать стоит под конкретный кадр, доступное железо и дедлайн.

MiniMax H3 и LTX 2.3: ключевые различия

ПараметрMiniMax H3LTX 2.3
Архитектура33B DiT + Qwen3-VL-32B encoderDiT-based, new VAE
Максимальное разрешение2K4K
Максимальная длительность15 секунд20 секунд (10 секунд в 4K/1440p)
АудиоНативный стереозвукНативное аудио, более чистый вокодер, endpoint audio-to-video
Поддержка LoRAПока нетStyle LoRAs, HDR IC-LoRA, character LoRAs
Портретный режимЧерез управление соотношением сторонНативный 9:16, обучение на портретных данных
Минимум VRAM для локального запуска8 ГБ (квантизация INT8)Практически около 12 ГБ (на младших картах сообщают об OOM)
ЛицензияMiniMax Community LicenseApache 2.0 для весов; LTX Model License для коммерческого использования при выручке свыше $10M
РелизAPI — 31 июля 2026; веса — 3 августа 2026Март 2026

Обе модели вышли с открытыми весами с разницей в несколько месяцев. У LTX 2.3 фора в пять месяцев и уже зрелая экосистема LoRA, а веса H3 на момент написания текста доступны всего восемь дней.

Скорость рендера и железо: главное ограничение

Разница в скорости для некоторых пайплайнов оказывается критичной, причём номинальный размер моделей здесь может ввести в заблуждение. H3 формально крупнее — 21 ГБ весов диффузии и 16 ГБ текстового энкодера, — но несколько пользователей отмечают, что на потребительских видеокартах она работает стабильнее LTX 2.3:

«Хотя технически она больше LTX 2.3, работает быстрее и создаёт меньше проблем с памятью. Недавно снова попробовал 2.3 и был раздражён её потреблением памяти». — пользователь Reddit dobomex761604, r/StableDiffusion

Однако стабильность не равна скорости. Вот замеры реального времени из того же обсуждения на Reddit:

ОборудованиеМодельДлительность / разрешениеРеальное время
RTX 3060 12 GBH3 (INT8)10 с / 480p~11 мин
RTX 3060 12 GBH3 (INT8)5 с / ~480p~3–4 мин
RTX 5090 24 GBH3 (full)15 с / 720p / 20 шагов48 мин
RTX 4080LTX 2.315 с / 1080p15–20 мин
RTX 4090LTX 2.35 с / 1080p25–40 с
RTX 4090Wan 2.2 (14B FP8)5 с / 1080p90–120 с

Практический совет от пользователя srikantpatnaik: зайдите в подграф ComfyUI и уменьшите число шагов с 20 до 10. Время генерации H3 сократится примерно на 40%, а падение качества останется приемлемым. Сейчас главная слабость H3 — соотношение секунд видео к разрешению.

С VRAM H3 приятно удивляет. INT8-версия с урезанными весами из дистрибутива самого ComfyUI запускается даже на картах с 8 ГБ VRAM и 16 ГБ системной памяти. По заметкам о тестировании пользователя Aadi_880, придётся ограничиться небольшим разрешением — 0,3–0,4 мегапикселя, примерно 480–600p, — и клипами до 5 секунд. Пользователи LTX 2.3, напротив, часто сталкиваются с OOM на 8-гигабайтных картах; один из них назвал работу с памятью «катастрофой».

Следование промпту и физика: преимущество H3

Если сильная сторона LTX — скорость, то по пониманию промптов H3 заметно впереди. Несколько участников упомянутого сравнения на Reddit выбрали H3 именно за следование запросу и физику:

«MiniMax H3 заметно проще в использовании. Она выдаёт вполне достойные сцены без запутанных, перегруженных описательных промптов. Одно это для меня решает вопрос». — пользователь Reddit nvidiot, r/StableDiffusion

«По моим тестам MiniMax очень хорошо понимает физику и следует промпту. Она не избегает графичных сцен — экшена или крови. Я получаю результат четырьмя предложениями, тогда как для LTX требовалось два абзаца». — пользователь Reddit Fit_Satisfaction2953

Главный разрыв в физике связан с постоянством объектов. В LTX 2.3 предметы нередко проходят друг сквозь друга или исчезают посреди сцены. В H3 используется 33B DiT, а текстовым энкодером служат скрытые состояния 50-го слоя Qwen3-VL-32B. Тестировщики из сообщества связывают более уверенное отслеживание объектов в пространстве именно с этой крупной архитектурой. Пользователь SX2k7 сформулировал проблему так: «В LTX вещи слишком часто без причины исчезают или проходят друг через друга».

Участники того же треда Reddit также отмечают, что H3 менее цензурирована, чем LTX и Wan: она пропускает экшен, кровь и физически напряжённые моменты, которые эти модели по умолчанию фильтруют.

Сохранение персонажа в image-to-video

Функция Ref2Vid (reference-to-video) — одна из самых сильных сторон H3, когда нужно удержать внешность героя. Подайте изображение персонажа, и, по отзывам тестировщиков из сообщества, модель сохраняет лицо на протяжении всего клипа, даже если герой уходит за пределы кадра и затем возвращается.

Режим image-to-video в LTX 2.3 стал лучше в этом релизе: меньше зависших сцен и ложного движения в стиле Ken Burns. Но дрейф идентичности по-прежнему остаётся известной проблемой:

«Да, я пробовал I2V: персонажа не было в кадре 10 секунд, а в конце он снова повернулся — и лицо осталось тем же. LTX же такая: “а это кто?”» — пользователь Reddit kemb0

Для предметных съёмок, стабильного персонажа и брендовых роликов, где одно и то же лицо должно сохраниться в 10-секундном клипе, Ref2Vid в H3 — более сильный вариант среди моделей с открытыми весами.

LoRA и работа от аудио: чем LTX удобнее для кастомизации

Здесь у LTX 2.3 пока есть системное преимущество, которого H3 ещё не может предложить. За несколько месяцев вокруг экосистемы LTX успели появиться специализированные инструменты:

  • Style LoRAs: дообучение под определённую визуальную эстетику — stop-motion, handmade или миниатюры — с возможностью менять адаптер для каждого кадра
  • HDR IC-LoRA: генерация сразу в HDR с расширенным динамическим диапазоном или преобразование SDR-материала в EXR для финального продакшена
  • Endpoint audio-to-video: загружаете аудиоклип, а LTX строит под него визуал — полезно для музыкального контента и коротких роликов, где важна синхронизация звука и движения
  • Воркфлоу seedhunter и director для ComfyUI: созданные сообществом многоэтапные пайплайны, которые перебирают seed для лучшего результата, а затем уточняют композицию
  • Нативный портретный 9:16: модель обучалась на вертикальных данных, а не получает вертикаль кропом из горизонтального кадра — критично для соцсетей
  • Режимы 24/48 FPS: гибкий выбор частоты кадров под требования к финальному материалу

У H3 набор возможностей заметно скромнее: text-to-video, image-to-video и reference-to-video со звуком. Нет ни пайплайна обучения LoRA, ни стилевых адаптеров, ни HDR-вывода. На момент написания веса модели доступны всего восемь дней, поэтому разрыв может сократиться. Но сегодня у авторов с готовыми библиотеками LoRA для LTX и настроенными графами ComfyUI есть вполне реальная цена перехода.

Пользователь l2ddit точно описал это противоречие: «Я так рад, что теперь могу удалить все эти LTX lora, которые ничего не сделали для исправления проблем. Единственное, в чём LTX была лучше, — синхронизация голоса не на английском».

Во сколько обойдётся локальный запуск и API

С точки зрения лицензий обе модели можно запускать локально бесплатно, но время рендера тоже имеет цену. У хостинговых API разница в тарифах заметна:

EndpointLTX 2.3 (fal.ai)MiniMax H3 (hosted)
Text-to-video 1080p$0.06/сЧерез API пока не опубликовано
Text-to-video 4K/2K$0.24/с (4K)Через API пока не опубликовано
Быстрый вариант 1080p$0.04/сN/A
Audio-to-video$0.10/сВключено в генерацию видео
Image-to-video$0.06–0.24/сВключено в генерацию видео
Extend / Retake$0.10/сПока недоступно

Для ориентира по бюджету: 5-секундный ролик 1080p через LTX 2.3 на fal.ai стоит $0.30. Быстрый вариант снижает цену до $0.20. На момент написания публичных тарифов на хостинговый API MiniMax H3 ещё не было. Локально обе модели бесплатны, однако 11-минутный рендер H3 на 3060 ощутимо увеличивает стоимость итераций.

Веса LTX 2.3 доступны на HuggingFace по Apache 2.0; коммерческое встраивание для компаний с годовой выручкой свыше $10M регулирует LTX Model License. Веса H3 опубликованы на HuggingFace по MiniMax Community License. Обе лицензии разрешают локальное офлайн-использование. Тарифы API для LTX 2.3 взяты со страницы модели на fal.ai.

Как распределять сцены в реальном продакшене

Большинству авторов не обязательно выбирать одну модель. Гибридный пайплайн позволяет использовать сильные стороны обеих:

Отправляйте сцену в H3, если:

  • Нужна сложная физика: столкновения, быстрое движение, взаимодействие объектов
  • Личность персонажа должна сохраняться в длинном клипе — например, в продуктовой демонстрации или сюжетной сцене
  • Требуется нативный стереозвук без отдельного этапа работы с аудио
  • Важна простота промпта: 4 предложения вместо 2 абзацев
  • У вас видеокарта начального уровня с 8–12 ГБ VRAM, и вы готовы мириться с долгим рендером

Отправляйте сцену в LTX 2.3, если:

  • Нужны быстрые итерации: раскадровки, проверка таймингов, черновые превью
  • Ваш визуальный стиль задаёт кастомная LoRA
  • Финальный формат — вертикальный контент 9:16 для соцсетей
  • Требуется 4K: H3 ограничена 2K
  • Нужна синхронизация audio-to-video, когда существующая аудиодорожка управляет визуальным рядом
  • Скорость важнее максимального качества каждого кадра

Рабочая схема выглядит так: сначала используйте LTX Fast, чтобы проверить мизансцену и тайминг, а утверждённый кадр отправляйте в H3 на финальный рендер с корректной физикой, идентичностью и аудио. Апскейл стоит делать только после утверждения сцены. Учитывая время повторного рендера H3, сначала лучше убедиться, что кадр уже собран правильно.

FAQ

MiniMax H3 лучше, чем LTX 2.3?

H3 выигрывает по качеству, следованию промпту и сохранению идентичности. LTX 2.3 быстрее, лучше подходит для кастомизации через LoRA и поддерживает 4K. Выбирайте по типу сцены, а не по бренду.

Можно ли запустить MiniMax H3 на потребительской видеокарте?

Да. INT8-версия с урезанными весами работает при 8 ГБ VRAM и 16 ГБ RAM, примерно в 480–600p и с роликами по 5 секунд. Для H3 в полной точности предпочтительны 24 ГБ VRAM.

Поддерживает ли H3 дообучение LoRA?

Пока нет. На момент релиза весов 3 августа 2026 года у H3 нет пайплайна LoRA. LTX 2.3 поддерживает Style LoRAs, HDR IC-LoRAs и character LoRAs.

У какой модели лучше звук?

Обе генерируют нативное аудио. H3 создаёт стереозвук с более насыщенными деталями окружения. В LTX 2.3 улучшен вокодер для более чистого результата, а endpoint audio-to-video позволяет генерировать визуал из входного аудиоклипа.

Сколько VRAM нужно для каждой модели?

H3 INT8: минимум 8 ГБ VRAM и 16 ГБ RAM для 480p. Для H3 в полной точности предпочтительны 24 ГБ VRAM. LTX 2.3: практический минимум около 12 ГБ VRAM; на картах с 8 ГБ сообщают об OOM.