← Todos los artículos

Pesas abiertas MiniMax H3: lo que realmente puedes ejecutar localmente

Pesas abiertas MiniMax H3: lo que realmente puedes ejecutar localmente

A principios de agosto, MiniMax publicó los pesos de su modelo de vídeo H3 en Hugging Face. Ahora se pueden generar clips con sonido estéreo en su propia máquina, sin suscripción ni tarifas API por generación. Pero antes de descargar cientos de gigabytes, tenga en cuenta dos cosas: la canalización completa de 2K no llegó a la versión abierta y la licencia no se lo permite a todos, en todas partes.

¿Qué fue exactamente lanzado?

El repositorio MiniMax-H3 incluye dos puntos de control específicos de tareas. FL2VA crea vídeo con sonido a partir de texto y puede animar fotogramas: tú proporcionas el primero, el último o ambos. Ref2VA crea un clip a partir de referencias: una sola solicitud puede incluir hasta nueve imágenes, tres videos y tres archivos de audio, por lo que la apariencia, el movimiento de la cámara, el estilo y la voz de un personaje se establecen con su propio ejemplo. El núcleo es un transformador denso de 33 mil millones de parámetros, los pesos se publican en BF16 y todo el repositorio pesa alrededor de 288 GB.

Qué puede hacer el modelo

H3 toma texto, imágenes, video y audio como entrada y produce clips de 4 a 15 segundos a 24 fps, con audio estéreo incorporado que el modelo sintetiza por sí mismo, en sincronización con la imagen. La resolución base es 768p en el lado corto. El audio no es aquí una etapa de procesamiento separada, sino parte del mismo modelo: puedes establecer una voz o un ritmo musical como referencia, lo que cambia notablemente el flujo de trabajo habitual.

Acerca de 2K: una advertencia importante

El 2K anunciado no proviene de la parte abierta del oleoducto. Un módulo separado llamado Regenerate-2K maneja el aumento de resolución, y MiniMax no lo lanzó: la ruta oficial hacia 2K es enviar el resultado local de 768p a la API en la nube de la compañía. Context-IR, el módulo que analiza combinaciones complejas de indicaciones y referencias, tampoco está abierto. Entonces, "ejecutar todo localmente" actualmente significa "ejecutar la generación base".

Transparent glass cubes with color gradients floating around a graphics card

¿Se las arreglará una computadora común y corriente?

El equipo de ComfyUI agregó soporte el día cero y optimizó en gran medida la ejecución: los pesos de modulación (alrededor del 40% de todos los parámetros) fueron reemplazados por una tabla de búsqueda compacta y la cuantificación int8 redujo la huella total de 123,6 GB a 42,5 GB. Combinado con la descarga dinámica a la RAM del sistema, eso es suficiente para que el modelo se ejecute en una tarjeta tan modesta como la RTX 3060. La comunidad fue más allá: han aparecido configuraciones WanGP para tarjetas con 5 a 6 GB de VRAM, que utilizan una descarga agresiva de RAM, resolución reducida y largos minutos por clip corto. Tenga en cuenta que estas son recetas de la comunidad, no requisitos oficiales: los detalles son más suaves y la estabilidad depende del tamaño de su RAM y la velocidad del disco. Para obtener una calidad total, los desarrolladores recomiendan tarjetas de primer nivel como la RTX 5090.

Licencias: esto no es código abierto en el sentido habitual

Los pesos son abiertos pero distribuidos bajo Licencia Comunitaria con condiciones. El uso comercial está permitido para empresas con ingresos anuales inferiores a 20 millones de dólares; las empresas más grandes necesitan un acuerdo por separado. Y lo más importante, la geografía: la licencia sólo cubre Estados Unidos, la Unión Europea, el Reino Unido y Corea del Sur; el uso en otros lugares requiere permiso por escrito de MiniMax. "Pesos abiertos" es el término exacto, no "código totalmente abierto".

¿Quién realmente necesita una carrera local?

Una instancia autohospedada tiene sentido cuando es importante la privacidad, el alto volumen de generación o el ajuste de sus propios datos: exactamente lo que permiten los pesos abiertos. Si solo desea un clip de calidad rápido, sin una granja de GPU ni problemas ambientales, la nube es más fácil: en elSección de vídeos de NeuralSpaceLos clips requieren un par de clics y cubrimos lo que el propio H3 puede hacer en nuestrorevisión separada.

Preguntas frecuentes

¿Qué GPU necesita MiniMax H3?

Para trabajar cómodamente, tarjetas de primer nivel con mucha memoria. En la práctica, la gente ejecuta la generación base incluso con 6 GB de VRAM a través de ComfyUI y WanGP, sacrificando resolución y velocidad: un clip corto puede tardar entre 10 y 15 minutos.

¿Puedo utilizar H3 comercialmente?

Sí, si los ingresos anuales de su empresa son inferiores a 20 millones de dólares, esa es una condición de Licencia comunitaria. Las organizaciones más grandes necesitan un acuerdo independiente con MiniMax.

¿Por qué H3 no es completamente de código abierto?

Solo la parte básica del proceso está abierta: los módulos para escalar a 2K y analizar referencias complejas permanecen cerrados, y la licencia restringe el uso comercial y las regiones.