MiniMax H3: co właściwie potrafi nowy model wideo AI
Istnieje prosty sposób na wyeksponowanie modelu wideo AI: poproś o ruch, a nie ładny portret. Skręć tkaninę w powietrzu, wyślij kamerę wokół obiektu, rozbij wodę o skałę, a słabe generatory zaczną topić krawędzie w ciągu sekundy. MiniMax H3 jest ciekawy, bo jego tonacją jest spójny ruch, a nie jedna fotogeniczna klatka.
Obejrzeliśmy pełną praktyczną recenzję po premierze i sprawdziliśmy jej zastrzeżenia techniczne z dokumentacją MiniMax. Oto przydatna część, pomijając hałas „kino jest martwe”.
Więcej niż zachęta i jedno zdjęcie
H3 rozumie tekst, obrazy, wideo i audio w jednym żądaniu. Możesz generować z tekstu, animować pierwszą klatkę, blokować zarówno początkową, jak i końcową klatkę lub zbudować klip z odniesień. Odniesienie może zawierać postać, ruch, ścieżkę kamery, styl wizualny, głos lub rytm edycji.
To zmienia pracę. Zamiast pisać akapit mówiący „kamera porusza się w ten sposób, a postać wygląda tak”, możesz pokazać krótki klip ruchomy i obraz w osobnym stylu. Model ma mniej możliwości błędnego odczytania.
Oficjalne limity są hojne: do 9 obrazów referencyjnych, 3 klipów wideo i 3 klipów audio, łącznie 12 plików mieszanych. Referencyjne wideo i audio mogą sumować się do 15 sekund. Podpowiedzi mogą mieć długość 7000 znaków — znacznie więcej, niż zwykle potrzeba w przypadku rozsądnego krótkiego ujęcia.

Tak, jest napisane 2 tys. Przeczytaj drobny druk
Sygnał wyjściowy to 768p lub 2K, a klipy trwają od 4 do 15 pełnych sekund. Obsługiwane są typowe współczynniki proporcji i tryb adaptacyjny. Na zwartą reklamę społecznościową wystarczy piętnaście sekund: odkryj obiekt, wykonaj jedną akcję, pokaż reakcję i wyląduj na ostatnim ujęciu.
Ale rozdzielczość to nie jakość. MiniMax dokumentuje również osobną ścieżkę regeneracji: gdy wynik 768p ma odpowiedni ruch, można go odbudować w rozdzielczości 2K, korzystając z oryginalnych wejść i klipu podstawowego. Na tym polega rozsądny przepływ pracy. Najpierw znajdź ujęcie; wydać na rozwiązanie drugie.
Gdzie H3 wygląda najsilniej
Najlepsze przykłady w recenzji obejmują szybkie ruchy kamery, płyn, materiał i oświetlenie, które muszą pozostać spójne podczas zmiany sceny. Referencje audio są mniej oczywistą wygraną. Mogą kierować głosem lub rytmem muzycznym obok materiału wizualnego.
Wyobraź sobie zdjęcie produktu z jednym nieruchomym zdjęciem, sześciosekundowym odniesieniem do ruchu kamery i krótkim akcentem dźwiękowym. Fotos zakotwicza produkt, wideo zapewnia orbitę, a dźwięk wyznacza rytm. Jest to o wiele bardziej precyzyjne niż „zrób reklamę premium”.
Haczyk
Spójność postaci jest lepsza, ale nie jest to gwarantowane. Dodaj kilka obiektów, które kolidują, przesłaniają się nawzajem i wracają do kadru, a mimo to mogą pojawić się przypadkowe szczegóły lub przeskoki kształtów. Drobne czytelne litery należy później dodać w edytorze.
A to są krótkie klipy, a nie gotowe filmy trzyminutowe. Dłuższa historia nadal wymaga listy ujęć, stabilnych odniesień i edycji. Pozostaje prawdziwa praca. H3 głównie przyspiesza etap surowego strzału.
Pierwsza zachęta, która Cię czegoś nauczy
Pomiń stos przymiotników. Określ temat, akcję, kamerę i światło: "Szklana butelka stoi na mokrym czarnym kamieniu. Za nią uderza fala; kamera powoli porusza się łukiem od prawej do lewej; zimne światło poranka; zakończ na zbliżeniu." Dołącz odniesienie do ruchu, gdy liczy się ścieżka kamery. Dodaj kilka perspektyw, jeśli tożsamość ma znaczenie.
Aby przetestować pomysł na własnym materiale, otwórzGenerowanie wideo AI w NeuralSpace. Potrzebujesz najpierw czystej ramy startowej? Zbuduj go wgenerator obrazu. Zacznij od pięciu lub sześciu sekund w rozdzielczości 768p. Złe wymaga mniejszych kosztów; dobry zarabia przepustkę 2K.