Lanciati a pochi giorni di distanza alla fine di luglio 2026, MiniMax H3 e Flux 3 sono stati subito messi alla prova dagli utenti di Reddit con gli stessi prompt. Non c’è un vincitore assoluto: H3 eccelle per risoluzione, fedeltà audio e controllo tramite riferimenti multimodali; Flux 3 punta invece su varietà creativa, durata delle clip e resa cinematografica. La scelta dipende quindi dalle specifiche che contano davvero nel proprio workflow.
Le specifiche che fanno davvero la differenza
Sulla carta MiniMax H3 e Flux 3 condividono le basi: entrambi generano video con audio nativo a partire da testo e immagini. Le differenze, però, emergono nei rispettivi limiti tecnici:
| Funzionalità | MiniMax H3 | Flux 3 Video |
|---|---|---|
| Risoluzione massima | 2K (predefinita) | 720p / 1080p |
| Durata massima | 15 secondi | 20 secondi |
| Audio | Audio stereo nativo | Sempre attivo (ambiente + dialoghi) |
| Input di riferimento | Fino a 9 immagini, 3 video, 3 audio (limite di 12 file) | Frame iniziale oppure primo + ultimo frame |
| Pesi open | Sì (HuggingFace) | No (solo API Early Access) |
| Modalità | Text-to-video, image-to-video, reference-to-video, primo/ultimo frame | Text-to-video, image-to-video, video-to-video, keyframe-to-video, continuazione audio |
H3 arriva a 2K, ma si ferma a 15 secondi; Flux 3 raggiunge i 20 secondi, restando però a 1080p. C’è anche un vincolo importante per il workflow: secondo la documentazione API MiniMax V2, nell’API di H3 la modalità riferimenti e quella primo/ultimo frame sono alternative tra loro.
Quanto costa una clip da 10 secondi
I prezzi cambiano sensibilmente in base al provider. MiniMax offre H3 direttamente tramite la propria API, mentre Flux 3 è disponibile attraverso Black Forest Labs Early Access e piattaforme partner.
| Provider | Modello | Risoluzione | Costo al secondo | Costo clip da 10 s |
|---|---|---|---|---|
| Piattaforma MiniMax | H3 | 2K | $0.13 | $1.30 |
| Piattaforma MiniMax | H3 | 768p (beta) | $0.09 | $0.90 |
| fal.ai | H3 | 2K | $0.26 | $2.60 |
| LetzAI | Flux 3 | 720p | ~100 crediti/s | ~1.000 crediti |
| LetzAI | Flux 3 | 1080p | ~160 crediti/s | ~1.600 crediti |
L’API diretta di MiniMax è la strada meno costosa per usare H3: $0.13/s in 2K, ovvero $1.95 per 15 secondi. Su fal.ai il costo raddoppia a $0.26/s. I crediti di Flux 3 e i prezzi in dollari di MiniMax non sono confrontabili direttamente senza conoscere il tasso di conversione crediti-dollaro di ciascun provider.
Audio: il vantaggio concreto di H3
Un utente Reddit che ha eseguito prompt equivalenti su entrambi i modelli l’ha riassunto senza mezzi termini:
"Una cosa che ho notato, soprattutto usando le cuffie, è che Minimax H3 DISTRUGGE letteralmente Flux 3 sul fronte audio. Si sente chiaramente nelle ultime due clip, ma con le cuffie provate a chiudere gli occhi, riascoltare il video e concentrarvi solo sulla differenza di qualità audio. Flux 3 non è semplicemente peggiore: il suo audio è visibilmente peggiore." - GrayingGamer, r/StableDiffusion
H3 crea un audio stereo nativo: dialoghi, rumori ambientali ed effetti fisici vengono distribuiti in un vero campo stereo. Flux 3 include sempre l’audio, senza un’opzione per disattivarlo, e con alcune voci può rendere i dialoghi in modo più naturale. Il livello ambientale e i suoni dell’ambiente risultano però sensibilmente più piatti. Nelle scene da documentario naturalistico o nelle animazioni, il paesaggio sonoro di H3 aggiunge un coinvolgimento che Flux 3 non raggiunge.
Il giudizio sulle voci è più sfumato: per alcuni ascoltatori il personaggio vichingo di Flux 3 suonava più naturale, mentre le voci narranti di H3 nei cartoni e nei documentari sono state ritenute più espressive. Nessuno dei due offre ancora audio pronto per il broadcast, ma H3 mantiene un vantaggio netto nel sound design ambientale.
Qualità visiva: ogni scena ha il suo vincitore
In un confronto su Reddit basato su quattro prompt, i due modelli hanno prevalso in scene diverse:
Vince Flux 3: una scena cinematografica con una nave vichinga e un volo in prima persona sul dorso di un drago. Flux 3 ha prodotto color grading più cinematografico, figure umane in movimento più credibili e un look complessivamente più da film. L’estetica da film in costume — grana, compressione da lente e luce dell’ora dorata — è il terreno in cui il modello di BFL dà il meglio.
Vince H3: un documentario naturalistico con una creatura dalle ali di cristallo che avanza nell’acqua e un cartone animato 2D con una ragazza scheletro. H3 ha offerto dettagli più nitidi in 2K, texture più coerenti sulle ali della creatura e animazioni del personaggio più espressive nello stile cartoon. La voce narrante del documentario era inoltre sincronizzata in modo pulito con i tempi delle immagini.
Va considerato un elemento cruciale: il test Reddit metteva il modello consumer H3 quantizzato int8 contro la versione API completa di Flux 3. Il commentatore Pyros-SD-Models ha osservato che H3 a precisione bf16 completa appare "molto meglio di quanto pubblicato dall’OP" nella scena vichinga. Questo suggerisce che il modello open-weight a piena precisione potrebbe ridurre il divario cinematografico mostrato dalla versione quantizzata. Si tratta comunque di un singolo test su quattro prompt, non di un benchmark sistematico.
La fisica resta incostante in entrambi i casi. L’utente Reddit kaidu ha osservato: "Per quanto H3 sia valido, ha ancora molti glitch e problemi di fisica. Curiosamente, sembrano comparire in modo piuttosto casuale. Nei tuoi esempi, per dire: il drago che cammina sull’acqua sembra molto realistico, mentre le persone che remano appaiono assolutamente terribili." Flux 3 soffre di fallimenti altrettanto arbitrari: i cicli di camminata nella scena vichinga sono stati definiti "orribili".
Riferimenti multimodali: il punto di forza decisivo di H3
Secondo la MiniMax V2 API, H3 accetta in una singola generazione fino a 9 immagini, 3 clip video e 3 clip audio come riferimenti, con un tetto di 12 file. È possibile dare istruzioni in linguaggio naturale, ad esempio: "Riprendi il movimento di camera hitchcockiano dal Video 1, fai cantare il personaggio nell’Immagine 2, con voce uguale all’Audio 3." H3 gestisce internamente questi riferimenti incrociati.
Flux 3 si limita invece a un frame iniziale per image-to-video oppure a una coppia primo-ultimo frame per l’animazione tramite keyframe, come indicato nella documentazione FLUX 3 di BFL. Non è possibile fornirgli contemporaneamente un’immagine di riferimento per lo stile, un video per il movimento e un audio di riferimento.
Per i workflow commerciali — packshot di prodotto, contenuti pubblicitari coerenti con il brand, scene guidate da personaggi che richiedono continuità rispetto ai riferimenti — il divario funzionale è decisivo. Il compromesso è che l’API H3 considera la modalità riferimenti e quella primo/ultimo frame mutuamente esclusive: non si possono combinare riferimenti multimodali e keyframe agli estremi nella stessa chiamata API.
Accesso e ecosistema dei provider
| Canale di accesso | MiniMax H3 | Flux 3 |
|---|---|---|
| API ufficiale | platform.minimax.io | bfl.ai/models/flux-3 (Early Access) |
| API di terze parti | fal.ai, Krea, OpenArt, Sogni | LetzAI, Comfy Cloud, fal.ai |
| Pesi open | HuggingFace | Non ancora (FLUX 3 Dev previsto) |
| Deploy locale | ComfyUI (int8/bf16 GGUF) | No |
H3 ha distribuito i pesi open a pochi giorni dal lancio ed è ora disponibile su HuggingFace. Gli sviluppatori possono eseguirlo in locale tramite ComfyUI, usando versioni GGUF quantizzate. Flux 3 rimane closed-source; il piano di lancio di BFL indica una release open-weight chiamata "FLUX 3 Dev" come prevista, ma senza una data.
Quale modello scegliere
| La tua priorità | Scegli | Motivo |
|---|---|---|
| Massima risoluzione | H3 | 2K nativo contro il limite di 1080p di Flux 3 |
| Clip singola più lunga | Flux 3 | 20 secondi contro i 15 di H3 |
| Qualità audio | H3 | Audio stereo e ambiente più ricco |
| Riferimenti multimodali | H3 | 9 immagini + video + audio in una chiamata |
| Look cinematografico / rétro | Flux 3 | Color grading ed estetica filmica superiori |
| Prezzo API diretto pubblicato | H3 | $0.13/s in 2K direttamente da MiniMax; i prezzi a crediti di Flux 3 variano in base al provider |
| Video-to-video | Flux 3 | H3 non offre V2V tramite lo stesso endpoint |
| Pesi open / locale | H3 | Pesi già disponibili; Flux 3 è closed |
| Video commerciali di prodotto | H3 | Rendering di testo e brand, coerenza dei riferimenti, dettaglio 2K |
| Filmmaking creativo | Flux 3 | Migliore direzione artistica da prompt e maggiore varietà stilistica |
In sintesi, H3 è la scelta giusta quando servono precisione, risoluzione, fedeltà ai riferimenti o un prezzo API diretto pubblicato. Flux 3 ha più senso quando la direzione creativa conta più delle specifiche tecniche, per inquadrature più lunghe, estetiche stilizzate e workflow video-to-video.
Si possono concatenare clip oltre il limite di durata?
Sì, ma con approcci diversi. La modalità primo più ultimo frame di H3 consente di usare il frame finale di una clip come frame iniziale della successiva, mantenendo la continuità tra due clip da 15 secondi e creando una sequenza di circa 30 secondi. Il keyframe condiviso aiuta a preservare composizione e identità del personaggio. Flux 3 supporta l’"agentic chaining": BFL lo descrive come il collegamento di singole clip in sequenze multi-inquadratura, usando riferimenti visivi per mantenere coerenti i personaggi tra scene. Nessuno dei due modelli genera in una sola volta oltre il proprio limite dichiarato, ma entrambi possono essere estesi con una pianificazione adeguata.
FAQ
MiniMax H3 può essere eseguito in locale?
Sì. MiniMax ha pubblicato i pesi del modello H3 su HuggingFace poco dopo il lancio. Le configurazioni della community per ComfyUI sono disponibili nei formati GGUF int8 e bf16. Il modello a piena precisione richiede molta VRAM, mentre le versioni quantizzate possono girare su GPU consumer.
Quale modello rende meglio il testo nei video?
Secondo i test ufficiali di MiniMax, H3 mostra una maggiore efficacia nel rendering di testo e loghi dei brand all’interno dei frame generati. È un aspetto rilevante nei workflow pubblicitari, dove nomi dei prodotti o testo dell’interfaccia devono comparire correttamente nel risultato.