← Tutti gli articoli

Pesi aperti MiniMax H3: cosa puoi effettivamente eseguire localmente

Pesi aperti MiniMax H3: cosa puoi effettivamente eseguire localmente

All'inizio di agosto, MiniMax ha pubblicato i pesi del suo modello video H3 su Hugging Face. Ora i clip con audio stereo possono essere generati sul tuo computer: nessun abbonamento, nessuna tariffa API per generazione. Ma prima di scaricare centinaia di gigabyte, tieni a mente due cose: l'intera pipeline 2K non è stata inclusa nella versione aperta e la licenza non lo consente a tutti, ovunque.

Cosa è stato rilasciato esattamente

Il repository MiniMax-H3 fornisce due checkpoint specifici per attività. FL2VA crea video con audio dal testo e può animare i fotogrammi: fornisci il primo, l'ultimo o entrambi. Ref2VA crea una clip partendo dai riferimenti: una singola richiesta può includere fino a nove immagini, tre video e tre file audio, quindi l'aspetto, il movimento della telecamera, lo stile e la voce di un personaggio sono impostati ciascuno dal proprio esempio. Il core è un denso trasformatore da 33 miliardi di parametri, i pesi sono pubblicati in BF16 e l'intero repository pesa circa 288 GB.

Cosa può fare il modello

H3 accetta testo, immagini, video e audio come input e produce clip da 4 a 15 secondi a 24 fps, con audio stereo integrato che il modello sintetizza automaticamente, in sincronia con l'immagine. La risoluzione base è 768p sul lato corto. L'audio non è una fase di elaborazione separata qui ma parte dello stesso modello: puoi impostare una voce o un ritmo musicale come riferimento, il che cambia notevolmente il normale flusso di lavoro.

Circa 2K: un avvertimento importante

Il 2K pubblicizzato non proviene dalla parte aperta della pipeline. Un modulo separato chiamato Regenerate-2K gestisce l'aumento della risoluzione e MiniMax non lo ha rilasciato: il percorso ufficiale verso 2K è inviare il risultato 768p locale all'API cloud dell'azienda. Anche Context-IR, il modulo che analizza combinazioni complesse di prompt e riferimenti, non è aperto. Quindi "eseguire tutto localmente" attualmente significa "eseguire la generazione di base".

Transparent glass cubes with color gradients floating around a graphics card

Un normale computer ce la farà?

Il team di ComfyUI ha aggiunto il supporto il giorno zero e ha ottimizzato notevolmente l'esecuzione: i pesi di modulazione, circa il 40% di tutti i parametri, sono stati sostituiti con una tabella di ricerca compatta e la quantizzazione int8 ha ridotto l'impronta totale da 123,6 GB a 42,5 GB. Combinato con l'offload dinamico sulla RAM di sistema, è sufficiente per far funzionare il modello su una scheda modesta come l'RTX 3060. La comunità è andata oltre: sono apparse configurazioni WanGP per schede con 5-6 GB di VRAM, che utilizzano un offload aggressivo della RAM, risoluzione ridotta e lunghi minuti per brevi clip. Tieni presente che queste sono ricette della community, non requisiti ufficiali: i dettagli risultano più morbidi e la stabilità dipende dalle dimensioni della RAM e dalla velocità del disco. Per la massima qualità, gli sviluppatori consigliano schede di alto livello come l'RTX 5090.

Licenza: non è open source nel senso comune del termine

I pesi sono aperti ma distribuiti sotto una licenza comunitaria con condizioni. L’uso commerciale è consentito alle aziende con meno di 20 milioni di dollari di fatturato annuo; le aziende più grandi necessitano di un accordo separato. E, soprattutto, la geografia: la licenza copre solo Stati Uniti, Unione Europea, Regno Unito e Corea del Sud; altrove l'uso richiede il permesso scritto di MiniMax. "Pesi aperti" è il termine accurato, non "completamente open source".

Chi ha davvero bisogno di una corsa locale

Un'istanza self-hosted ha senso quando sono importanti la privacy, l'elevato volume di generazione o la messa a punto dei propri dati, esattamente ciò che i pesi aperti consentono. Se desideri solo una clip di qualità veloce, senza una GPU farm o problemi ambientali, il cloud è più semplice: inSezione video di NeuralSpacele clip richiedono un paio di clic e abbiamo spiegato cosa può fare H3 stesso nel nostrorevisione separata.

Domande frequenti

Di quale GPU ha bisogno il MiniMax H3?

Per un lavoro confortevole, carte di alto livello con molta memoria. In pratica le persone eseguono la generazione di base anche su 6 GB di VRAM tramite ComfyUI e WanGP, sacrificando risoluzione e velocità: una breve clip può richiedere 10-15 minuti.

Posso usare H3 a livello commerciale?

Sì, se il fatturato annuo della tua azienda è inferiore a 20 milioni di dollari, questa è una condizione della licenza comunitaria. Le organizzazioni più grandi necessitano di un accordo separato con MiniMax.

Perché H3 non è completamente open source?

Solo la parte base della pipeline è aperta: i moduli per l'upscaling a 2K e l'analisi di riferimenti complessi rimangono chiusi e la licenza limita l'uso commerciale e le regioni.