
In breve
MiniMax H3 è il modello video omni-modale di MiniMax, lanciato il 31 luglio 2026: contesto unificato testo / immagine / video / audio, video fino a 15 secondi, un percorso di consegna in 2K e stereo nativo nello stesso passaggio (post ufficiale su H3; Reuters). MiniMax H3 Max è una variante ospitata e post-addestrata a partire dai pesi di H3, pubblica dal 26 agosto 2026. Non è un aggiornamento di H3 con il marchio MiniMax: genera in 480p o 768p (non 2K), da testo o da immagine (con fotogramma finale facoltativo), 5–15 secondi, con audio nativo. Scegli H3 Max quando vuoi una bozza veloce a 768p; resta su H3 su questo sito per video da testo o da immagine in 2K (fotogramma finale facoltativo). Le specifiche di MiniMax per H3 includono ancora l’omni-reference — fino a nove immagini, tre video e tre clip audio — ma il generatore di questo sito oggi non può allegare quei file video o audio aggiuntivi (post su H3; note sull’open source).
Punti chiave
- Due prodotti, una famiglia. H3 è il modello di luglio di MiniMax (post su H3). H3 Max è un successivo post-addestramento ospitato dei pesi open di H3, annunciato nelle classifiche di terze parti il 26 agosto 2026 (Artificial Analysis; Design Arena).
- La risoluzione è la prima differenza. La promessa pubblica di H3 è il 2K (l’H3-Base open genera ancora con il lato corto a 768; il 2K è la fase di rigenerazione) (note sull’open source). H3 Max si ferma a 768p (con una fascia di bozza a 480p).
- I riferimenti sono la seconda differenza. Le specifiche di MiniMax per H3 collegano fino a nove immagini, tre video e tre clip audio in una sola richiesta (post su H3; note sull’open source). Al lancio H3 Max genera da testo a video e da immagine a video, con un fotogramma finale facoltativo: non l’intero set di riferimenti. Anche il generatore H3 di questo sito genera solo da testo a video e da immagine a video (2K, fotogramma finale facoltativo). Oggi non accetta riferimenti misti video o audio.
- La velocità è il motivo per cui Max esiste. Il post di Design Arena del 26 agosto riportava ~6,4 s da immagine a video e ~4,7 s da testo a video, e descriveva Max come molto più veloce dell’H3 base in quell’arena (Design Arena). Considerali tempi misurati nell’arena, non una promessa di livello di servizio.
- Classifiche, fotografia al 27 agosto 2026. Nella classifica da immagine a video con audio di Artificial Analysis, H3 Max è primo (Elo 1204, ±10, 5123 campioni) e H3 a pesi open è terzo (Elo 1184) (classifica I2V). In quella da testo a video con audio, H3 Max è terzo (Elo 1235) e H3 è quarto (Elo 1225): i primi tre sono separati da pochi punti (classifica T2V).
- Pesi. I checkpoint di H3 sono pubblici (Hugging Face MiniMax-H3). I pesi di H3 Max non sono pubblici al momento in cui scriviamo. Alcuni articoli indipendenti hanno segnalato l’intenzione di rilasciarli; non è la stessa cosa di un download (Artificial Analysis).
Testa a testa
| Aspetto | MiniMax H3 | MiniMax H3 Max |
|---|---|---|
| Che cos’è | Il modello video omni-modale di MiniMax (post su H3) | Variante ospitata e post-addestrata di H3, per velocità e aderenza al prompt |
| Finestra pubblica | 31 luglio 2026 (Reuters) | 26 agosto 2026, classifiche di terze parti (AA) |
| Risoluzione | Percorso 2K; lato corto predefinito del modello base open 768 (note sull’open source) | 480p o 768p, nessuna fascia 2K |
| Durata | 4–15 s secondo le specifiche open source di MiniMax (note sull’open source) | 5–15 s |
| Audio | Stereo nativo insieme all’immagine (post su H3) | Audio nativo insieme all’immagine |
| Input | Testo, immagini, video, audio; omni-reference (post su H3) | Da testo a video e da immagine a video; fotogramma finale facoltativo |
| Segnale sulla velocità | Percorso ospitato più lento nelle stesse arene | Design Arena: I2V ~6,4 s, T2V ~4,7 s (post) |
| I2V con audio (27 ago 2026) | Elo 1184, primo tra i modelli a pesi open (AA I2V) | Elo 1204, primo in quella classifica |
| T2V con audio (27 ago 2026) | Elo 1225, quarto (AA T2V) | Elo 1235, terzo |
| Pesi | H3-Base pubblico (Hugging Face) | Non pubblici |
| Prima prova | Generatore video H3: testo o immagine in 2K | Generatore video H3 Max |
Basta una lettura della tabella: se il brief è iterare a 768p da testo o immagine finché il movimento regge, H3 Max. Se il brief richiede video da testo o da immagine in 2K, usa H3 su questo sito. I riferimenti misti immagine / video / audio di MiniMax sono una specifica ufficiale di H3; questo generatore non può accettare quei file aggiuntivi.
Famiglie e cronologia
Tieni separati tre nomi.
MiniMax H3 (indicato anche come Hailuo 3 / Hailuo 03 su alcune piattaforme) è il modello video di luglio 2026 della linea Hailuo: Hailuo 01 → Hailuo 02 / 2.3 → H3 (post su H3). Non è MiniMax M3, il modello linguistico / agentico di giugno (pagina di M3).
MiniMax H3 Max non è «H3 ma con il 2K ufficiale». È un post-addestramento ospitato, successivo, dei pesi di H3. I materiali di MiniMax di luglio e agosto descrivono H3 e la release dei pesi open; non annunciano un prodotto MiniMax chiamato H3 Max. Sono state le classifiche di terze parti e i post del 26 agosto a rendere pubblico il nome Max (Artificial Analysis; Design Arena).
La divisione dei pesi open conta ancora per H3: MiniMax ha pubblicato H3-Base (generazione di classe 768p + stereo) e ha tenuto H3-Context-IR e H3-Regenerate-2K come fasi ospitate (note sull’open source). Tutto ciò che viene post-addestrato solo a partire dal modello base pubblico eredita quel limite di 768p, a meno che non venga aggiunta una fase 2K separata. È il motivo tecnico per cui Max non sostituisce la promessa 2K di H3.
Per il quadro originale del lancio di H3, vedi Lancio di MiniMax H3: video IA in 2K con audio stereo nativo (31 luglio 2026).
Com’è H3 in movimento
Questo video è un esempio di H3 della community ripubblicato sulla CDN di questo sito. Mostra la densità commerciale di H3. Qui non abbiamo una coppia H3 vs H3 Max con lo stesso prompt: non è un test A/B di laboratorio.
Chi vince in quale scenario
| Se il tuo collo di bottiglia è… | Preferisci | Perché |
|---|---|---|
| Tante bozze da 5–10 s in una sola sessione | H3 Max | La velocità in arena è il motivo dichiarato per cui Max esiste (Design Arena) |
| Un’immagine che deve mantenere l’identità mentre si muove | H3 Max da immagine a video | Parti da un fotogramma nel generatore da immagine a video H3 Max di questo sito, poi genera |
| Consegna in 2K, loghi, caratteri piccoli | H3 | Il 2K è il percorso di H3; Max non ha una fascia 2K (post su H3; note sull’open source) |
| Personaggio + movimento + voce da file misti | Specifica ufficiale di H3, non questo generatore | MiniMax documenta l’omni-reference per H3 (post su H3). Oggi questo sito non può allegare Video 1 / Audio 1. |
| Blocco di primo e ultimo fotogramma | Entrambi, con una riserva | Primo/ultimo fotogramma è una modalità centrale di H3; la modalità da immagine a video di Max accetta un fotogramma finale facoltativo, ma non è l’omni-reference completo |
| Hosting in proprio / fine-tuning del checkpoint open | H3 | I pesi pubblici sono quelli di H3-Base (Hugging Face) |
Divisione pratica: abbozza il movimento su MiniMax H3 Max finché camera e azione reggono. Porta la ripresa migliore su MiniMax H3 quando vuoi il passaggio in 2K dello stesso testo o della stessa immagine. I riferimenti misti video/audio restano una capacità ufficiale di H3, non qualcosa che questo generatore può accettare.
Cosa sappiamo e cosa no
| Lo sappiamo (con fonte) | Non lo sappiamo / non lo affermiamo |
|---|---|
| H3 è stato lanciato il 31 luglio 2026: omni-modale, ≤15 s, promessa 2K, stereo nativo, poi pesi open (post su H3; note sull’open source; Reuters) | Che MiniMax stessa abbia lanciato un prodotto chiamato H3 Max |
| H3 Max è un post-addestramento ospitato di H3, pubblico nelle classifiche dal 26 agosto 2026, 5–15 s, fino a 768p, T2V + I2V (AA) | Che Max possa oggi generare in 2K, con omni-reference o con editing tramite istruzioni |
| Il generatore H3 di questo sito: da testo a video e da immagine a video in 2K, fotogramma finale facoltativo | Che oggi tu possa caricare video o audio di riferimento in questo generatore |
| AA I2V con audio: primo Max (Elo 1204) e terzo H3 (Elo 1184) al 27 agosto 2026 (classifica I2V) | Che l’Elo resti uguale la settimana prossima |
| Design Arena ha pubblicato per Max I2V ~6,4 s / T2V ~4,7 s (Design Arena) | Il tempo di coda in una giornata piena; «sempre più veloce della riproduzione» come garanzia di servizio |
| I pesi di H3 sono scaricabili; quelli di Max no, al momento in cui scriviamo (Hugging Face) | Una data per i pesi di Max |
Come valutarli entrambi
Usa gli stessi Prompt A e B su entrambi i generatori. Non inventare un nuovo brief a metà strada. Il Prompt C serve solo a leggere le specifiche.
- Apri MiniMax H3 Max ed esegui il Prompt A a 5 s / 768p.
- Apri MiniMax H3 su questo sito ed esegui di nuovo il Prompt A.
- Valuta tenuta del soggetto, inseguimento della camera, coerenza dell’audio e se le eventuali scritte a schermo restano leggibili.
- Se hai già un’immagine, esegui il Prompt B da immagine a video su Max, poi usa la stessa immagine nel generatore H3 di questo sito.
- Il Prompt C è un controllo da leggere sulla specifica ufficiale di omni-reference di H3. Non incollarlo nel generatore di questo sito: quell’interfaccia non può accettare Video 1 o Audio 1.
Non è un test A/B di laboratorio. È il test onesto più breve: una frase, due generatori, una decisione.
I prompt restano in inglese, così puoi incollarli identici in entrambi i generatori.
Prompt A — prodotto protagonista (16:9, entrambi i modelli)
Un film di prodotto di lusso da 5 secondi: un unico avvicinamento continuo su un orologio in metallo spazzolato appoggiato sul marmo, con la luce della finestra che scorre sul vetro e, in stereo, solo il suono della stanza e un ticchettio.
5s luxury product film, 16:9, photoreal. One continuous push-in on a brushed metal watch on marble, window light crawling across the crystal, shallow depth of field. Native stereo: quiet room tone and a single tick. No extra logos. Cinematic grade.
Prompt B — dall’immagine al movimento (da immagine a video)
Usa l’immagine caricata come primo fotogramma e le gira intorno lentamente per 10 secondi, con un movimento contenuto, senza cambiare identità, abiti o aggiungere persone.
Keep the uploaded still as the first frame. Slow 10s orbit around the subject, small amplitude, no identity drift, no new wardrobe, no extra people. Native stereo: soft room tone only. 16:9 if the still allows it.
Prompt C — omni-reference ufficiale di H3 (non eseguibile qui)
Questo prompt serve a leggere le specifiche di H3 di MiniMax: combina l’identità del personaggio da un’immagine, il linguaggio di camera da un video e l’energia vocale da un audio. Non è un passaggio da fare su questo sito.
Match character identity from Image 1, camera language from Video 1, and vocal energy from Audio 1. 12s fashion lookbook walk through a rain-wet night street, neon reflections, confident pace, native stereo footsteps and city hush.
FAQ
MiniMax H3 Max è solo un MiniMax H3 più veloce?
No. Max è un post-addestramento ospitato di H3, ottimizzato per velocità e aderenza al prompt a 768p, con generazione da testo a video e da immagine a video. Le specifiche di MiniMax per H3 coprono ancora il 2K e l’omni-reference (post su H3; AA). Su questo sito puoi usare H3 solo da testo a video e da immagine a video in 2K.
È stata MiniMax a rilasciare H3 Max?
I post delle classifiche pubbliche del 26 agosto 2026 hanno presentato H3 Max come variante post-addestrata di H3 (Artificial Analysis; Design Arena). Il lancio di H3 e le note sui pesi open di MiniMax descrivono H3, non un prodotto MiniMax chiamato Max (post su H3; note sull’open source).
MiniMax H3 Max può generare in 2K?
Non sul percorso che possiamo confermare. Max è 480p / 768p. Per il 2K, usa MiniMax H3 (note sull’open source).
H3 Max genera l’audio?
Sì. Le descrizioni pubbliche di Max includono l’audio nativo insieme all’immagine, nella stessa famiglia dello stereo nativo di H3 (AA; post su H3).
Quanto può durare un video?
Le specifiche open source di H3 indicano 4–15 secondi. H3 Max, nel generatore a cui rimandiamo, fa 5–15 secondi. Prevedi un’azione per ogni generazione (note sull’open source).
H3 Max è primo in tutto?
No. Al 27 agosto 2026 è in testa nella classifica da immagine a video con audio di Artificial Analysis. In quella da testo a video con audio è terzo, dentro un gruppo di testa molto ravvicinato (I2V; T2V). Le classifiche cambiano.
Posso scaricare i pesi di H3 Max?
Non al momento in cui scriviamo. H3-Base è su Hugging Face. Considera qualsiasi frase del tipo «Max sarà open» come un’intenzione, non come un file.
Dove provo ciascuno?
Bozze con H3 Max: generatore video H3 Max di questo sito. H3 in 2K da testo o immagine (fotogramma finale facoltativo): generatore video H3 di questo sito. Hai già un’immagine? Parti dal generatore da immagine a video H3 Max di questo sito. I riferimenti misti immagine + video + audio sono nelle specifiche di H3 di MiniMax, ma oggi non in questo generatore.
Conviene usarli entrambi?
Sì, in sequenza: Max per trovare il movimento, H3 di questo sito per il passaggio in 2K da testo o immagine. L’omni-reference di MiniMax con file misti resta fuori da questo generatore.
Hailuo 03 è lo stesso modello di H3 Max?
No. Hailuo 03 / Hailuo 3.0 di solito indica MiniMax H3. H3 Max è il successivo post-addestramento ospitato (post su H3).
Chi è Casey Ren
Casey Ren è analista di modelli video IA: segue le release video di MiniMax / Hailuo e trasforma le dichiarazioni pubbliche di lancio in percorsi chiari per provare MiniMax H3. I fatti in questo articolo seguono le fonti primarie linkate, non un accesso privato a laboratori.
