MiniMax H3: o que o novo modelo de vídeo AI pode realmente fazer
Existe uma maneira fácil de expor um modelo de vídeo de IA: peça movimento, não um retrato bonito. Torça o tecido no ar, envie uma câmera ao redor de um objeto, jogue água contra uma rocha – e geradores fracos começarão a derreter as bordas em um segundo. MiniMax H3 é interessante porque seu tom é um movimento coerente, não um quadro fotogênico.
Assistimos à análise prática completa por trás do lançamento e comparamos suas afirmações técnicas com a documentação do MiniMax. Aqui está a parte útil, sem o ruído de “o cinema está morto”.
Mais do que um prompt e uma imagem
H3 compreende texto, imagens, vídeo e áudio dentro de uma solicitação. Você pode gerar a partir de texto, animar um primeiro quadro, bloquear os quadros de abertura e final ou criar um clipe a partir de referências. Uma referência pode conter um personagem, movimento, caminho de câmera, estilo visual, voz ou ritmo de edição.
Isso muda o trabalho. Em vez de escrever um parágrafo que diz “a câmera se move assim e o personagem fica assim”, você pode mostrar um pequeno clipe de movimento e uma imagem de estilo separada. Há menos para o modelo interpretar mal.
Os limites oficiais são generosos: até 9 imagens de referência, 3 videoclipes e 3 videoclipes, com 12 arquivos mixados no total. O vídeo e o áudio de referência podem adicionar até 15 segundos cada. Os prompts podem atingir 7.000 caracteres – muito mais do que um plano curto e sensato normalmente precisa.

Sim, diz 2K. Leia as letras pequenas
A saída é 768p ou 2K e os clipes duram de 4 a 15 segundos inteiros. Proporções de aspecto comuns e um modo adaptativo são suportados. Quinze segundos são suficientes para um anúncio social compacto: revele o objeto, execute uma ação, mostre uma reação, chegue à cena final.
Mas resolução não é qualidade. MiniMax também documenta um caminho de regeneração separado: uma vez que um resultado 768p tenha o movimento correto, ele pode ser reconstruído em 2K usando as entradas originais e o clipe base. Esse é o fluxo de trabalho sensato. Encontre a tomada primeiro; gastar na resolução em segundo lugar.
Onde H3 parece mais forte
Os melhores exemplos da análise envolvem movimentos rápidos de câmera, líquidos, tecidos e iluminação que devem permanecer consistentes enquanto a cena muda. As referências de áudio são a vitória menos óbvia. Eles podem guiar uma voz ou ritmo musical junto com o material visual.
Imagine uma foto de um produto com uma imagem estática, uma referência de movimento de câmera de seis segundos e um breve destaque sonoro. A imagem fixa o produto, o vídeo fornece a órbita e o áudio define o ritmo. Isso é muito mais preciso do que “fazer um comercial premium”.
A captura
A consistência dos personagens é melhor, não garantida. Adicione vários objetos que colidem, ocluem uns aos outros e retornam ao enquadramento, e detalhes perdidos ou saltos de forma ainda podem aparecer. Letras minúsculas e legíveis devem ser adicionadas posteriormente em um editor.
E estes são clipes curtos, não filmes finalizados de três minutos. Uma história mais longa ainda precisa de uma lista de cenas, referências estáveis e uma edição. O verdadeiro trabalho permanece. H3 principalmente torna o estágio de captura bruta mais rápido.
Um primeiro prompt que lhe ensinará algo
Pule a pilha de adjetivos. Especifique o assunto, a ação, a câmera e a luz: "Uma garrafa de vidro está sobre uma pedra preta molhada. Uma onda bate atrás dela; a câmera faz um arco lento da direita para a esquerda; luz fria da manhã; finalize em um close-up." Anexe uma referência de movimento quando o caminho da câmera for importante. Adicione vários ângulos quando a identidade for importante.
Para testar a ideia com seu próprio material, abra Geração de vídeo AI em NeuralSpace. Precisa primeiro de um quadro inicial limpo? Construa-o no gerador de imagem. Comece com cinco ou seis segundos a 768p. As coisas ruins custam menos; um bom ganha o passe de 2K.