← Все статьи

MiniMax H3: perkara yang sebenarnya boleh dilakukan oleh model video AI baharu

MiniMax H3: perkara yang sebenarnya boleh dilakukan oleh model video AI baharu

Terdapat cara mudah untuk mendedahkan model video AI: minta gerakan, bukan potret cantik. Putar fabrik di udara, hantar kamera mengelilingi objek, merempuhkan air ke dalam batu—dan penjana yang lemah mula mencairkan tepi dalam sesaat. MiniMax H3 menarik kerana picnya adalah gerakan koheren, bukan satu bingkai fotogenik.

Kami menonton semakan langsung sepenuhnya di sebalik pelancaran dan menyemak tuntutan teknikalnya terhadap dokumentasi MiniMax. Inilah bahagian yang berguna, tolak bunyi "pawagam sudah mati".

Lebih daripada gesaan dan satu gambar

H3 memahami teks, imej, video dan audio dalam satu permintaan. Anda boleh menjana daripada teks, menghidupkan bingkai pertama, mengunci kedua-dua bingkai pembukaan dan penamat, atau membina klip daripada rujukan. Rujukan boleh membawa watak, pergerakan, laluan kamera, gaya visual, suara atau irama penyuntingan.

Itu mengubah pekerjaan. Daripada menulis perenggan yang mengatakan "kamera bergerak seperti ini dan wataknya kelihatan seperti itu," anda boleh menunjukkan klip gerakan pendek dan imej gaya yang berasingan. Terdapat lebih sedikit model untuk salah baca.

Had rasmi adalah besar: sehingga 9 imej rujukan, 3 klip video dan 3 klip audio, dengan 12 fail bercampur kesemuanya. Video dan audio rujukan masing-masing boleh menambah sehingga 15 saat. Gesaan boleh mencapai 7,000 aksara—jauh lebih daripada tangkapan pendek yang wajar yang biasa diperlukan.

Complex motion, fabric, water and camera movement in AI video generation

Ya, ia berkata 2K. Baca cetakan kecil

Output ialah 768p atau 2K, dan klip dijalankan dari 4 hingga 15 saat keseluruhan. Nisbah aspek biasa dan mod penyesuaian disokong. Lima belas saat sudah cukup untuk iklan sosial yang padat: mendedahkan objek, melakukan satu tindakan, menunjukkan reaksi, mendarat pada tangkapan terakhir.

Tetapi resolusi tidak berkualiti. MiniMax juga mendokumenkan laluan penjanaan semula yang berasingan: setelah hasil 768p mempunyai gerakan yang betul, ia boleh dibina semula pada 2K menggunakan input asal dan klip asas. Itulah aliran kerja yang masuk akal. Cari ambil dahulu; berbelanja untuk resolusi kedua.

Di mana H3 kelihatan paling kuat

Contoh terbaik ulasan itu melibatkan pergerakan kamera pantas, cecair, kain dan pencahayaan yang mesti kekal konsisten semasa adegan berubah. Rujukan audio adalah kemenangan yang kurang jelas. Mereka boleh membimbing suara atau irama muzik bersama bahan visual.

Gambar tangkapan produk dengan satu imej pegun, rujukan gerakan kamera enam saat dan loghat bunyi pendek. Pegun melabuhkan produk, video membekalkan orbit, dan audio menetapkan rentak. Itu jauh lebih tepat daripada "buat komersial premium."

Hasil tangkapan

Konsistensi watak adalah lebih baik, tidak dijamin. Tambahkan beberapa objek yang berlanggar, menutup satu sama lain dan kembali ke bingkai, dan butiran sesat atau lompatan bentuk masih boleh muncul. Huruf kecil yang boleh dibaca hendaklah ditambah dalam editor selepas itu.

Dan ini adalah klip pendek, belum selesai filem tiga minit. Cerita yang lebih panjang masih memerlukan senarai pukulan, rujukan yang stabil dan pengeditan. Kerja hakiki kekal. H3 terutamanya menjadikan peringkat pukulan mentah lebih cepat.

Gesaan pertama yang akan mengajar anda sesuatu

Langkau timbunan kata sifat. Nyatakan subjek, aksi, kamera dan cahaya: "Sebotol kaca berdiri di atas batu hitam yang basah. Gelombang melanda di belakangnya; kamera melengkung perlahan ke kanan ke kiri; cahaya pagi yang sejuk; selesai dengan jarak dekat." Lampirkan rujukan gerakan apabila laluan kamera penting. Tambahkan beberapa sudut apabila identiti penting.

Untuk menguji idea dengan bahan anda sendiri, bukaPenjanaan video AI dalam NeuralSpace. Perlukan bingkai permulaan yang bersih dahulu? Bina dalampenjana imej. Mulakan dengan lima atau enam saat pada 768p. Buruk memerlukan kos yang lebih rendah; yang bagus mendapat pas 2K.