Tienes una RTX 3060 con 12 GB de VRAM y un plano pendiente de generar: ¿lo mandas a MiniMax H3 o a LTX 2.3? Los dos son modelos de vídeo open-weights, incluyen audio nativo y pueden ejecutarse localmente con ComfyUI. Sin embargo, sus ritmos no podrían ser más distintos: uno saca un clip de 5 segundos a 1080p en menos de 40 segundos; el otro necesita 11 minutos para 10 segundos a 480p. A cambio, la comunidad de Reddit considera que la física del modelo lento no tiene comparación. La elección no va de coronar a un ganador absoluto, sino de asignar cada plano al modelo que encaja con tu hardware y tu fecha de entrega.
MiniMax H3 y LTX 2.3: diferencias clave
| Especificación | MiniMax H3 | LTX 2.3 |
|---|---|---|
| Arquitectura | 33B DiT + codificador Qwen3-VL-32B | Basada en DiT, nuevo VAE |
| Resolución máxima | 2K | 4K |
| Duración máxima | 15 segundos | 20 segundos (10 s a 4K/1440p) |
| Audio | Sonido estéreo nativo | Audio nativo, vocoder más limpio y endpoint de audio a vídeo |
| Compatibilidad con LoRA | Aún no | LoRA de estilo, HDR IC-LoRA y LoRA de personajes |
| Modo retrato | Mediante control de relación de aspecto | 9:16 nativo, entrenado con datos en vertical |
| VRAM mínima (local) | 8 GB (cuantizado INT8) | ~12 GB en la práctica (hay reportes de OOM en tarjetas inferiores) |
| Licencia | MiniMax Community License | Pesos Apache 2.0; LTX Model License para uso comercial por encima de $10M de ingresos |
| Lanzamiento | API el 31 de julio de 2026; pesos el 3 de agosto de 2026 | Marzo de 2026 |
Ambos llegaron al terreno open-weights con pocos meses de diferencia. LTX 2.3 cuenta con cinco meses de ventaja y un ecosistema LoRA ya maduro, mientras que los pesos de H3 apenas tienen ocho días en el momento de escribir estas líneas.
Velocidad y hardware: el cuello de botella de verdad
Para algunos flujos de trabajo, la diferencia de velocidad resulta directamente inviable. Y el tamaño bruto de los modelos lleva a engaño: H3 es, sobre el papel, más grande —21 GB de pesos de difusión y 16 GB para el codificador de texto—, pero varios usuarios aseguran que se comporta de forma más estable que LTX 2.3 en hardware de consumo:
"Aunque técnicamente es más grande que LTX 2.3, funciona más rápido y da menos problemas de memoria. Hace poco volví a probar 2.3 y me frustró su consumo de memoria." - Usuario de Reddit dobomex761604, r/StableDiffusion
Eso sí, estabilidad no equivale a velocidad. Estos son los tiempos reales recogidos en el mismo hilo comparativo de Reddit:
| Hardware | Modelo | Duración / Resolución | Tiempo real |
|---|---|---|---|
| RTX 3060 12 GB | H3 (INT8) | 10 s / 480p | ~11 min |
| RTX 3060 12 GB | H3 (INT8) | 5 s / ~480p | ~3-4 min |
| RTX 5090 24 GB | H3 (completo) | 15 s / 720p / 20 pasos | 48 min |
| RTX 4080 | LTX 2.3 | 15 s / 1080p | 15-20 min |
| RTX 4090 | LTX 2.3 | 5 s / 1080p | 25-40 s |
| RTX 4090 | Wan 2.2 (14B FP8) | 5 s / 1080p | 90-120 s |
El usuario srikantpatnaik comparte un ajuste útil: entrar en el subgrafo de ComfyUI y reducir los pasos de 20 a 10 recorta aproximadamente un 40% del tiempo de generación de H3, con una pérdida de calidad asumible. Ahora mismo, su mayor lastre es la relación entre segundos generados y resolución.
En VRAM, H3 sorprende. El modelo podado a INT8 distribuido por ComfyUI puede funcionar con tarjetas de solo 8 GB de VRAM y 16 GB de RAM del sistema, aunque queda limitado a resoluciones pequeñas —0,3-0,4 megapíxeles, aproximadamente 480-600p— y clips de 5 segundos, según las pruebas del usuario Aadi_880. En LTX 2.3, en cambio, abundan los errores OOM con tarjetas de 8 GB; un usuario llegó a calificar la experiencia con la memoria como "un desastre".
Seguimiento del prompt y física: H3 marca la diferencia
Si LTX domina en rapidez, H3 toma una clara ventaja al interpretar prompts. Varios participantes del hilo comparativo de Reddit prefieren H3 tanto por su fidelidad al prompt como por su comportamiento físico:
"MiniMax H3 es bastante más fácil de usar. Se pueden generar escenas bastante decentes sin escribir prompts rebuscados y excesivamente descriptivos. Solo por eso, para mí ya gana." - Usuario de Reddit nvidiot, r/StableDiffusion
"Según mis pruebas, Minimax entiende muy bien la física y sigue muy bien el prompt. No evita escenas explícitas como acción o sangre. Puedo conseguir el resultado con 4 frases, frente a LTX, que necesitaba 2 párrafos." - Usuario de Reddit Fit_Satisfaction2953
La brecha en física se aprecia especialmente en la permanencia de los objetos. LTX 2.3 deja con frecuencia que los elementos se atraviesen, desaparezcan a mitad de escena o se muevan sin motivo. H3 usa un DiT de 33B junto con los estados ocultos de la capa 50 de Qwen3-VL-32B como codificador de texto, y quienes lo han probado atribuyen su mejor seguimiento espacial a esta arquitectura de mayor tamaño. El usuario SX2k7 lo resumía así: "Con LTX, las cosas desaparecen o se atraviesan sin razón demasiado a menudo".
En el mismo hilo de Reddit, los usuarios también señalan que H3 aplica menos censura que LTX y Wan: permite escenas de acción, sangre y momentos físicamente intensos que los otros modelos filtran por defecto.
Mejor continuidad de identidad en image-to-video
La función Ref2Vid (referencia a vídeo) de H3 destaca especialmente cuando importa conservar una identidad. Al proporcionarle una imagen de personaje, quienes lo han probado en la comunidad informan de que mantiene los rasgos faciales durante todo el clip, incluso si el personaje sale de plano y vuelve a aparecer.
El modo image-to-video de LTX 2.3 ha mejorado en esta versión —menos congelaciones y menos falsos movimientos tipo Ken Burns—, pero el cambio de identidad sigue siendo un problema conocido:
"Sí, probé un I2V en el que el personaje estaba fuera de plano durante 10 segundos y volvía a mirar al final; misma cara idéntica. LTX está en plan: '¿y este quién es?'" - Usuario de Reddit kemb0
Para planos de producto, consistencia de personajes y trabajos de marca en los que una misma cara debe mantenerse durante un clip de 10 segundos, Ref2Vid de H3 es la opción más sólida entre los modelos open-weights.
Flujos LoRA reactivos al audio: la ventaja de personalización de LTX
Este es el punto en el que LTX 2.3 conserva una ventaja estructural que H3 todavía no puede igualar. El ecosistema LTX ha tenido meses para desarrollar herramientas a medida:
- LoRA de estilo: Ajusta el modelo a una estética visual concreta —stop-motion, artesanal o miniaturas— y cámbialos según el plano
- HDR IC-LoRA: Genera directamente en HDR con rango dinámico ampliado o convierte material SDR a EXR para flujos de acabado
- Endpoint de audio a vídeo: Le das un clip de audio y LTX crea imágenes que lo acompañan; resulta útil para contenido musical y clips sociales donde importa sincronizar sonido y movimiento
- Flujos seedhunter y director de ComfyUI: Procesos comunitarios de varias pasadas que iteran semillas para localizar el mejor resultado y después refinar la composición
- Vertical 9:16 nativo: Entrenado con datos en orientación vertical, no recortado desde formato horizontal; clave para contenido social vertical
- Opciones de 24/48 FPS: Flexibilidad de frecuencia de imagen para ajustarse a las especificaciones de entrega
El flujo de H3 es, en comparación, más básico: texto a vídeo, imagen a vídeo y referencia a vídeo con audio. No hay pipeline de entrenamiento LoRA, adaptadores de estilo ni salida HDR. Sus pesos tienen ocho días en el momento de escribir este artículo, por lo que estas carencias podrían resolverse, pero hoy los creadores con bibliotecas LoRA de LTX y grafos de ComfyUI ya ajustados afrontan un coste real al cambiar de plataforma.
El usuario l2ddit resumió bien esa tensión: "Me alegra muchísimo poder borrar todos esos loras de LTX que no arreglaban nada. Lo único que LTX hacía mejor era la sincronización de voz en idiomas distintos del inglés".
Costes: ejecución local frente a API
Ejecutar cualquiera de los dos modelos de forma local no tiene coste de licencia, pero el tiempo sí cuesta. En APIs alojadas, la diferencia de precios es considerable:
| Endpoint | LTX 2.3 (fal.ai) | MiniMax H3 (alojado) |
|---|---|---|
| Texto a vídeo 1080p | $0.06/s | Aún no publicado vía API |
| Texto a vídeo 4K/2K | $0.24/s (4K) | Aún no publicado vía API |
| Variante Fast 1080p | $0.04/s | N/A |
| Audio a vídeo | $0.10/s | Incluido con el vídeo |
| Imagen a vídeo | $0.06-0.24/s | Incluido con el vídeo |
| Extend / Retake | $0.10/s | Aún no disponible |
Para ponerlo en cifras: un clip de 5 segundos a 1080p con LTX 2.3 a través de fal.ai cuesta $0.30. La variante Fast lo baja a $0.20. El precio de la API alojada de MiniMax H3 aún no se había publicado de forma pública en el momento de escribir este artículo. En local, ambos se pueden ejecutar gratis, pero los 11 minutos de renderizado de H3 en una 3060 añaden un coste real a cada iteración.
Los pesos de LTX 2.3 están disponibles en HuggingFace bajo Apache 2.0; la LTX Model License regula la integración comercial para empresas con más de $10M de ingresos anuales. Los pesos de H3 están en HuggingFace bajo la MiniMax Community License. Ambos permiten uso local y sin conexión. Los precios de la API de LTX 2.3 proceden de la página del modelo en fal.ai.
Qué modelo usar en producción según el plano
La mayoría de creadores no tiene por qué elegir un único modelo. Un flujo híbrido permite aprovechar lo mejor de cada uno:
Envía el plano a H3 cuando:
- Necesite física compleja: colisiones, movimiento rápido o interacciones físicas
- La identidad de un personaje deba mantenerse durante un clip largo, como en revelaciones de producto o escenas narrativas
- Busques audio estéreo nativo sin una pasada de sonido separada
- Te importe trabajar con prompts sencillos, de 4 frases en lugar de 2 párrafos
- Tu GPU sea modesta, con 8-12 GB de VRAM, y puedas aceptar tiempos de renderizado más largos
Envía el plano a LTX 2.3 cuando:
- Necesites iterar rápido: storyboards, pruebas de ritmo o previsualizaciones
- Un LoRA personalizado defina tu estilo visual
- El entregable sea contenido social vertical en 9:16
- Necesites resolución 4K, ya que H3 se limita a 2K
- Requieras sincronía audio a vídeo y una pista de audio existente deba dirigir las imágenes
- La velocidad importe más que la máxima calidad por fotograma
Un flujo práctico sería usar LTX Fast para validar el bloqueo y el ritmo, y después lanzar en H3 el plano aprobado para el renderizado final, aprovechando su física, identidad y audio. Aplica un reescalado solo cuando el plano esté aprobado. Dado el coste de tiempo de volver a ejecutar H3, merece la pena acertar antes con la toma.
Preguntas frecuentes
¿MiniMax H3 es mejor que LTX 2.3?
H3 gana en calidad, seguimiento del prompt y conservación de identidad. LTX 2.3 gana en velocidad, personalización con LoRA y salida 4K. Conviene decidir según el tipo de plano, no por la marca.
¿Puede MiniMax H3 ejecutarse en GPU de consumo?
Sí. El modelo podado a INT8 funciona con 8 GB de VRAM + 16 GB de RAM a aproximadamente 480-600p y 5 segundos. La versión de precisión completa se beneficia de 24 GB de VRAM.
¿H3 admite ajuste fino con LoRA?
Todavía no. Tras el lanzamiento de los pesos del 3 de agosto de 2026, H3 no cuenta con un pipeline LoRA. LTX 2.3 admite LoRA de estilo, HDR IC-LoRA y LoRA de personajes.
¿Qué modelo ofrece mejor audio?
Los dos generan audio nativo. H3 produce sonido estéreo con detalles ambientales más ricos. LTX 2.3 ha mejorado su vocoder para una salida más limpia y ofrece un endpoint de audio a vídeo que genera imágenes a partir de un clip de audio de entrada.
¿Cuánta VRAM necesita cada modelo?
H3 INT8: mínimo 8 GB de VRAM + 16 GB de RAM para 480p. H3 en precisión completa se beneficia de 24 GB de VRAM. LTX 2.3: mínimo práctico de ~12 GB de VRAM, con reportes de OOM en tarjetas de 8 GB.