Poids ouverts MiniMax H3 : ce que vous pouvez réellement exécuter localement
Début août, MiniMax a publié les poids de son modèle vidéo H3 sur Hugging Face. Les clips avec son stéréo peuvent désormais être générés sur votre propre machine – sans abonnement, ni frais API par génération. Mais avant de télécharger des centaines de gigaoctets, gardez deux choses à l’esprit : le pipeline 2K complet n’a pas été inclus dans la version ouverte, et la licence ne l’autorise pas à tout le monde, partout.
Qu'est-ce qui a été publié exactement
Le référentiel MiniMax-H3 contient deux points de contrôle spécifiques aux tâches. FL2VA crée une vidéo avec du son à partir de texte et peut animer des images : vous fournissez la première, la dernière ou les deux. Ref2VA crée un clip à partir de références : une seule demande peut inclure jusqu'à neuf images, trois vidéos et trois fichiers audio, de sorte que l'apparence, le mouvement de la caméra, le style et la voix d'un personnage sont chacun définis par leur propre exemple. Le cœur est un transformateur dense de 33 milliards de paramètres, les poids sont publiés dans BF16 et l'ensemble du référentiel pèse environ 288 Go.
Ce que le modèle peut faire
H3 prend du texte, des images, de la vidéo et de l'audio en entrée et produit des clips de 4 à 15 secondes à 24 ips — avec un son stéréo intégré que le modèle synthétise lui-même, en synchronisation avec l'image. La résolution de base est de 768p sur le côté court. L'audio n'est pas ici une étape de traitement distincte mais fait partie du même modèle : vous pouvez définir une voix ou un rythme musical par référence, ce qui modifie sensiblement le flux de travail habituel.
À propos de 2K – une mise en garde importante
Le 2K annoncé ne provient pas de la partie ouverte du pipeline. Un module distinct appelé Regenerate-2K gère l'augmentation de la résolution, et MiniMax ne l'a pas publié : la voie officielle vers 2K consiste à renvoyer votre résultat 768p local à l'API cloud de l'entreprise. Context-IR, le module qui analyse des combinaisons complexes d'invites et de références, n'est pas non plus ouvert. Ainsi, « tout exécuter localement » signifie actuellement « exécuter la génération de base ».

Un ordinateur ordinaire s’en sortira-t-il ?
L'équipe ComfyUI a ajouté la prise en charge dès le premier jour et a considérablement optimisé l'exécution : les poids de modulation (environ 40 % de tous les paramètres) ont été remplacés par une table de recherche compacte, et la quantification int8 a réduit l'empreinte totale de 123,6 Go à 42,5 Go. Combiné avec un déchargement dynamique vers la RAM système, cela suffit pour que le modèle fonctionne sur une carte aussi modeste que la RTX 3060. La communauté est allée plus loin : des configurations WanGP pour les cartes avec 5 à 6 Go de VRAM sont apparues, utilisant un déchargement agressif de la RAM, une résolution réduite et de longues minutes par clip court. Gardez à l’esprit qu’il s’agit de recettes communautaires et non d’exigences officielles : les détails ressortent plus doucement et la stabilité dépend de la taille de votre RAM et de la vitesse de votre disque. Pour une qualité totale, les développeurs recommandent des cartes haut de gamme comme la RTX 5090.
Licence : ce n'est pas open source au sens habituel du terme
Les poids sont ouverts mais distribués sous Licence Communautaire sous conditions. L'utilisation commerciale est autorisée pour les entreprises dont le chiffre d'affaires annuel est inférieur à 20 millions de dollars. Les grandes entreprises ont besoin d'un accord distinct. Et surtout, la géographie : la licence ne couvre que les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud ; toute utilisation ailleurs nécessite l'autorisation écrite de MiniMax. « Poids ouverts » est le terme exact, et non « entièrement open source ».
Qui a vraiment besoin d'une course locale
Une instance auto-hébergée est logique lorsque la confidentialité, un volume de génération élevé ou le réglage précis de vos propres données sont importants – exactement ce que permettent les pondérations ouvertes. Si vous souhaitez simplement obtenir rapidement un clip de qualité, sans ferme de GPU ni soucis d'environnement, le cloud est plus simple : dans leSection vidéo NeuralSpaceles clips prennent quelques clics, et nous avons expliqué ce que H3 lui-même peut faire dans notreexamen séparé.
FAQ
De quel GPU le MiniMax H3 a-t-il besoin ?
Pour un travail confortable, des cartes haut de gamme avec beaucoup de mémoire. Dans la pratique, les gens exécutent la génération de base même sur 6 Go de VRAM via ComfyUI et WanGP, en échangeant la résolution et la vitesse : un court clip peut prendre 10 à 15 minutes.
Puis-je utiliser H3 à des fins commerciales ?
Oui, si le chiffre d'affaires annuel de votre entreprise est inférieur à 20 millions de dollars, il s'agit d'une condition de licence communautaire. Les grandes organisations ont besoin d'un accord distinct avec MiniMax.
Pourquoi H3 n’est-il pas entièrement open source ?
Seule la partie de base du pipeline est ouverte : les modules de mise à l'échelle vers 2K et d'analyse de références complexes restent fermés, et la licence restreint l'utilisation commerciale et les régions.