← Todos os artigos

MiniMax H3 pesos abertos: o que você pode realmente executar localmente

Uma placa gráfica em uma mesa escura com uma tira de filme brilhante com quadros abstratos saindo dela

No início de agosto, MiniMax publicou os pesos de seu modelo de vídeo H3 no Hugging Face. Clipes com som estéreo agora podem ser gerados em sua própria máquina — sem assinatura, sem taxas de API por geração. Mas antes de baixar centenas de gigabytes, tenha duas coisas em mente: o pipeline completo de 2K não foi lançado no lançamento aberto e a licença não permite a todos, em todos os lugares.

O que exatamente foi lançado

O repositório MiniMax-H3 envia dois pontos de verificação específicos de tarefas. FL2VA cria vídeo com som de texto e pode animar quadros: você fornece o primeiro, o último ou ambos. Ref2VA constrói um clipe a partir de referências - uma única solicitação pode incluir até nove imagens, três vídeos e três arquivos de áudio, de modo que a aparência, o movimento da câmera, o estilo e a voz de um personagem são definidos por seu próprio exemplo. O núcleo é um transformador denso de 33 bilhões de parâmetros, os pesos são publicados no BF16 e todo o repositório pesa cerca de 288 GB.

O que o modelo pode fazer

H3 recebe texto, imagens, vídeo e áudio como entrada e produz clipes de 4 a 15 segundos a 24 fps — com áudio estéreo integrado que o próprio modelo sintetiza, em sincronia com a imagem. A resolução básica é 768p no lado curto. O áudio não é um estágio de processamento separado aqui, mas parte do mesmo modelo: você pode definir uma voz ou ritmo musical por referência, o que altera visivelmente o fluxo de trabalho normal.

Cerca de 2K – uma advertência importante

Os 2K anunciados não vêm da parte aberta do pipeline. Um módulo separado chamado Regenerate-2K cuida do aumento de resolução e MiniMax não o liberou: o caminho oficial para 2K é enviar seu resultado local de 768p de volta para a API de nuvem da empresa. O Context-IR, o módulo que analisa combinações complexas de prompts e referências, também não está aberto. Portanto, "executar tudo localmente" atualmente significa "executar a geração de base".

Cubos de vidro transparentes com gradientes de cores flutuando em torno de uma placa gráfica

Um computador comum aguentará?

A equipe do ComfyUI adicionou suporte no dia zero e otimizou fortemente a execução: os pesos de modulação — cerca de 40% de todos os parâmetros — foram substituídos por uma tabela de pesquisa compacta e a quantização int8 reduziu o espaço total de 123,6 GB para 42,5 GB. Combinado com o descarregamento dinâmico para a RAM do sistema, isso é suficiente para que o modelo rode em uma placa tão modesta quanto a RTX 3060. A comunidade foi além: surgiram configurações WanGP para placas com 5–6 GB de VRAM, usando descarregamento agressivo de RAM, resolução reduzida e longos minutos por clipe curto. Tenha em mente que estas são receitas da comunidade, não requisitos oficiais: os detalhes são mais suaves e a estabilidade depende do tamanho da RAM e da velocidade do disco. Para qualidade total, os desenvolvedores recomendam placas de primeira linha, como a RTX 5090.

Licenciamento: este não é código aberto no sentido usual

Os pesos são abertos, mas distribuídos sob uma licença comunitária com condições. O uso comercial é permitido para empresas com receita anual inferior a US$ 20 milhões – empresas maiores precisam de um acordo separado. E, o que é crucial, a geografia: a licença cobre apenas os EUA, a União Europeia, o Reino Unido e a Coreia do Sul; o uso em outros lugares requer permissão por escrito de MiniMax. "Pesos abertos" é o termo correto, não "código totalmente aberto".

Quem realmente precisa de uma corrida local

Uma instância auto-hospedada faz sentido quando a privacidade, o alto volume de geração ou o ajuste fino de seus próprios dados são importantes – exatamente o que os pesos abertos permitem. Se você deseja apenas um clipe de qualidade rápido, sem problemas de GPU ou ambiente, a nuvem é mais fácil: no NeuralSpace seção de vídeo clipes levam alguns cliques e cobrimos o que o próprio H3 pode fazer em nosso revisão separada.

Perguntas frequentes

Qual GPU o MiniMax H3 precisa?

Para um trabalho confortável, cartões de primeira linha com bastante memória. Na prática, as pessoas executam a geração básica mesmo em 6 GB de VRAM por meio de ComfyUI e WanGP, trocando resolução e velocidade: um clipe curto pode levar de 10 a 15 minutos.

Posso usar H3 comercialmente?

Sim, se a receita anual da sua empresa for inferior a US$ 20 milhões — essa é uma condição da Licença Comunitária. Organizações maiores precisam de um acordo separado com MiniMax.

Por que o H3 não é totalmente de código aberto?

Apenas a parte base do pipeline está aberta: os módulos para upscaling para 2K e análise de referências complexas permanecem fechados, e a licença restringe o uso comercial e regiões.