← Alla artiklar

MiniMax H3: vad den nya AI-videomodellen faktiskt kan göra

MiniMax H3: vad den nya AI-videomodellen faktiskt kan göra

Det finns ett enkelt sätt att exponera en AI-videomodell: be om rörelse, inte ett vackert porträtt. Vrid tyg i luften, skicka en kamera runt ett föremål, krascha vatten i en sten – och svaga generatorer börjar smälta kanter inom en sekund. MiniMax H3 är intressant eftersom dess tonhöjd är koherent rörelse, inte en enda fotogen ram.

Vi tittade på den fullständiga praktiska granskningen bakom lanseringen och kontrollerade dess tekniska påståenden mot MiniMax dokumentation. Här är den användbara delen, minus "bioljudet är dött".

Mer än en uppmaning och en bild

H3 förstår text, bilder, video och ljud i en begäran. Du kan skapa från text, animera en första bildruta, låsa både öppnings- och slutramen eller bygga ett klipp från referenser. En referens kan bära en karaktär, rörelse, kamerabana, visuell stil, röst eller redigeringsrytm.

Det förändrar jobbet. Istället för att skriva ett stycke som säger "kameran rör sig så här och karaktären ser ut så", kan du visa ett kort rörligt klipp och en separat stilbild. Det är mindre för modellen att misstolka.

De officiella gränserna är generösa: upp till 9 referensbilder, 3 videoklipp och 3 ljudklipp, med totalt 12 blandade filer. Referensvideo och ljud kan vardera lägga till upp till 15 sekunder. Uppmaningar kan nå 7 000 tecken – mycket mer än vad ett vettigt kortskott normalt behöver.

Complex motion, fabric, water and camera movement in AI video generation

Ja, det står 2K. Läs det finstilta

Utdata är 768p eller 2K, och klipp kör från 4 till 15 hela sekunder. Vanliga bildförhållanden och ett adaptivt läge stöds. Femton sekunder räcker för en kompakt social annons: avslöja föremålet, utför en åtgärd, visa en reaktion, landa på det sista skottet.

Men upplösning är inte kvalitet. MiniMax dokumenterar också en separat regenereringsväg: när ett 768p-resultat har rätt rörelse kan det byggas om i 2K med originalingångarna och basklämman. Det är det förnuftiga arbetsflödet. Hitta ta först; spendera på upplösning sekund.

Där H3 ser starkast ut

Recensionens bästa exempel involverar snabba kamerarörelser, vätska, tyg och belysning som måste förbli konsekvent medan scenen ändras. Ljudreferenser är den mindre uppenbara vinsten. De kan styra en röst eller musikalisk rytm vid sidan av det visuella materialet.

Föreställ dig en produktfotograferad med en stillbild, en sex sekunders kamerarörelsereferens och en kort ljudaccent. Stillbilden förankrar produkten, videon förser omloppsbanan och ljudet sätter takten. Det är mycket mer exakt än att "göra en premiumreklam."

Fångsten

Karaktärskonsistensen är bättre, inte garanterad. Lägg till flera objekt som kolliderar, blockerar varandra och återgår till ram, så kan lösa detaljer eller formhopp fortfarande dyka upp. Små läsbara bokstäver bör läggas till i en editor efteråt.

Och det är korta klipp, inte färdiga treminutersfilmer. En längre berättelse behöver fortfarande en skottlista, stabila referenser och en redigering. Verkligt arbete återstår. H3 gör främst råskottsstadiet snabbare.

En första uppmaning som kommer att lära dig något

Hoppa över högen med adjektiv. Ange motiv, action, kamera och ljus: "En glasflaska står på en våt svart sten. En våg slår bakom den; kameran bågar långsamt höger till vänster; kallt morgonljus; avsluta på en närbild." Bifoga en rörelsereferens när kamerabanan är viktig. Lägg till flera infallsvinklar när identitet spelar roll.

För att testa idén med ditt eget material, öppnaAI-videogenerering i NeuralSpace. Behöver du en ren startram först? Bygg den ibildgenerator. Börja med fem eller sex sekunder vid 768p. Dåliga tar kostar mindre; en bra får 2K-passet.