← Все статьи

MiniMax H3: apa yang sebenarnya dapat dilakukan oleh model video AI baru

MiniMax H3: apa yang sebenarnya dapat dilakukan oleh model video AI baru

Ada cara mudah untuk mengekspos model video AI: mintalah gerakan, bukan potret yang cantik. Memutar kain di udara, mengirim kamera ke sekeliling objek, menabrakkan air ke batu—dan generator yang lemah akan mulai melelehkan tepian benda dalam hitungan detik. MiniMax H3 menarik karena nadanya merupakan gerakan yang koheren, bukan satu bingkai fotogenik.

Kami menyaksikan ulasan langsung lengkap di balik peluncuran dan memeriksa klaim teknisnya berdasarkan dokumentasi MiniMax. Inilah bagian yang berguna, tanpa kebisingan “bioskop mati”.

Lebih dari sekedar prompt dan satu gambar

H3 memahami teks, gambar, video dan audio dalam satu permintaan. Anda dapat membuat dari teks, menganimasikan bingkai pertama, mengunci bingkai pembuka dan penutup, atau membuat klip dari referensi. Referensi dapat memuat karakter, gerakan, jalur kamera, gaya visual, suara, atau ritme pengeditan.

Itu mengubah pekerjaan. Daripada menulis paragraf yang mengatakan “kamera bergerak seperti ini dan karakter terlihat seperti itu”, Anda dapat menampilkan klip gerak pendek dan gambar gaya terpisah. Model akan lebih kecil kemungkinannya untuk salah membaca.

Batasan resminya sangat besar: hingga 9 gambar referensi, 3 klip video, dan 3 klip audio, dengan total 12 file campuran. Video referensi dan audio masing-masing dapat berdurasi hingga 15 detik. Perintah dapat mencapai 7.000 karakter—jauh lebih banyak daripada yang biasanya dibutuhkan oleh gambar pendek yang masuk akal.

Complex motion, fabric, water and camera movement in AI video generation

Ya, katanya 2K. Baca cetakan kecilnya

Outputnya 768p atau 2K, dan klip berdurasi 4 hingga 15 detik penuh. Rasio aspek umum dan mode adaptif didukung. Lima belas detik sudah cukup untuk iklan sosial yang ringkas: menampilkan objek, melakukan satu tindakan, menunjukkan reaksi, mendarat di bidikan terakhir.

Namun resolusi bukanlah kualitas. MiniMax juga mendokumentasikan jalur regenerasi terpisah: setelah hasil 768p memiliki gerakan yang tepat, hasil tersebut dapat dibuat ulang pada 2K menggunakan input asli dan klip dasar. Itu adalah alur kerja yang masuk akal. Temukan pengambilannya terlebih dahulu; habiskan untuk resolusi kedua.

Dimana H3 terlihat paling kuat

Contoh terbaik ulasan ini melibatkan pergerakan kamera yang cepat, cairan, kain, dan pencahayaan yang harus tetap konsisten saat pemandangan berubah. Referensi audio adalah keuntungan yang kurang jelas. Mereka dapat memandu ritme suara atau musik di samping materi visual.

Bayangkan hasil jepretan produk dengan satu gambar diam, referensi gerakan kamera enam detik, dan aksen suara singkat. Gambar diam menjadi penanda produk, video menyuplai orbit, dan audio menentukan irama. Ini jauh lebih tepat daripada “membuat iklan premium”.

Hasil tangkapannya

Konsistensi karakter lebih baik, tidak terjamin. Tambahkan beberapa objek yang bertabrakan, saling menghalangi dan kembali ke bingkai, dan detail yang menyimpang atau lompatan bentuk masih dapat muncul. Huruf kecil yang mudah dibaca harus ditambahkan di editor sesudahnya.

Dan ini adalah klip pendek, bukan film berdurasi tiga menit yang sudah selesai. Cerita yang lebih panjang masih memerlukan daftar pengambilan gambar, referensi stabil, dan pengeditan. Pekerjaan nyata tetap ada. H3 terutama membuat tahap pengambilan gambar mentah lebih cepat.

Perintah pertama yang akan mengajari Anda sesuatu

Lewati tumpukan kata sifat. Tentukan subjek, tindakan, kamera, dan cahaya: "Sebuah botol kaca berdiri di atas batu hitam basah. Gelombang menghantam di belakangnya; kamera melengkung perlahan dari kanan ke kiri; cahaya pagi yang dingin; selesai dalam jarak dekat." Lampirkan referensi gerakan jika jalur kamera penting. Tambahkan beberapa sudut ketika identitas penting.

Untuk menguji ide dengan materi Anda sendiri, bukaPembuatan video AI di NeuralSpace. Butuh kerangka awal yang bersih terlebih dahulu? Bangun dipembuat gambar. Mulailah dengan lima atau enam detik pada 768p. Yang buruk membutuhkan biaya lebih sedikit; yang bagus mendapat izin 2K.