← Все статьи

Gemini Omni Video: apa yang dapat dilakukan mode video real-time Google

Gemini Omni Video: apa yang dapat dilakukan mode video real-time Google

Versi pendek (BLUF)

Gemini Omni adalah mode video waktu nyata Google: arahkan kamera, dan model menjelaskan, menerjemahkan, atau men-debug apa yang dilihatnya secara langsung. Dari mana kata "Omni" berasal, apa yang sebenarnya dilakukan model tersebut dengan video, dan apa yang harus diketahui oleh pengguna Rusia.

Minggu lalu seorang kolega mengirimi saya video — seseorang menunjukkan lemari pakaiannya di siaran langsung sementara Gemini mengomentari pakaian tersebut secara real-time dan menyarankan pakaian. Pikiran pertama: "demo lain yang tidak pernah berhasil di kehidupan nyata." Pemikiran kedua, setelah mengujinya: berhasil. Tidak sempurna, tapi berhasil.

Gemini Omni Live mode: the model watches a camera feed in real time and answers questions about what is in the frame, latency around 300 ms

Dari mana kata "Omni" berasal

"Omni" berarti "sekaligus". Sama seperti GPT-4o (omni), Gemini kini memiliki mode di mana model bekerja dengan teks, suara, gambar, dan video secara bersamaan. Tidak satu demi satu. Bukan "bingkai dulu, jawab nanti". Sebagai aliran.

Secara khusus, Gemini Omni Video dapat mengambil umpan kamera langsung dan bereaksi terhadap apa yang terjadi secara real-time. Beri nama objek. Membaca teks di layar. Jawab pertanyaan tentang apa yang ada di bingkai saat ini.

Secara teknis ini adalah Multimodal Live API. Aliran video masuk ke server Google, model memprosesnya dan membalas dengan penundaan 200–400 ms. Itu sudah terasa seperti percakapan, bukan permintaan dan tanggapan.

Apa yang sebenarnya dilakukan model dengan video

Ada baiknya memisahkan tiga hal berbeda:

  • Menganalisis video yang diunggah— Anda memasukkan klip dan memintanya untuk mendeskripsikan rekaman atau menemukan momen tertentu. Ini sudah berhasil pada tahun 2024.
  • Modus waktu nyata— model mengawasi melalui kamera bersama Anda. Ini berbeda secara mendasar.
  • Pembuatan video— di sini Google meluncurkan Veo 3 secara terpisah; itu cerita lain dan alat lain.

Dalam mode Omni Live Anda dapat mengarahkan ponsel Anda ke panel listrik yang rusak dan bertanya "ada apa" — dan mendapatkan jawaban hampir seketika, tanpa menunggu upload. Atau tunjukkan suatu hidangan di restoran dan pelajari bahan-bahan kasarnya. Atau tunjukkan kode di monitor Anda dan dapatkan masukan segera.

Honest comparison for a user in Russia: Gemini Omni Live needs a VPN and a foreign card; NeuralSpace works in rubles without a VPN for analyzing and generating video

Kasus nyata: men-debug kode melalui kamera

Salah satu skenario paling praktis adalah streaming layar Anda saat melakukan debug. Buka Google AI Studio, aktifkan mode video, tampilkan IDE Anda. Tanyakan: "mengapa ini nol di sini?" — model melihat jejak tumpukan sebenarnya dan jawaban langsung pada intinya.

Saya bekerja seperti ini dengan skrip Python selama sekitar dua puluh menit. Latensi rendah, jawaban tepat sasaran. Satu-satunya kendala — setelah 20 menit ponsel mulai memanas, jadi saya beralih ke laptop.

Ini juga berfungsi baik dengan dokumen. Letakkan selembar kertas di depan kamera, ajukan pertanyaan — model membaca teks dan menjawab. Kadang-kadang tersandung pada font yang tidak biasa, tetapi keakuratannya secara keseluruhan cukup baik.

Dimana hasil tangkapannya

Izinkan saya jujur ​​tentang apa yang menjengkelkan.

Pertama — akses. Gemini 2.0 dengan Omni Video ada di Google AI Studio dan di aplikasi dengan langganan Lanjutan. Ada sidang. Setelah itu — Anda membayar. Anda tidak dapat menambahkan kartu bank Rusia. VPN diperlukan bukan hanya untuk mendaftar, namun agar streaming dapat berjalan dengan stabil.

Kedua — privasi. Saat Anda melakukan streaming video ke Google, video itu pergi ke suatu tempat. Perusahaan mengatakan "kami tidak menyimpannya", tetapi Anda mempercayainya.

Ketiga — batas sesi. Anda tidak bisa menonton selamanya; ada batasan panjang aliran. Dan kualitasnya menurun drastis jika koneksinya buruk.

Apa yang harus dilakukan pengguna Rusia

Dua jalur.

Yang pertama — VPN + Google AI Studio. Ini berfungsi, tetapi dengan sakit kepala: Anda memerlukan koneksi yang stabil, kartu non-Rusia, dan terkadang sesi terhenti begitu saja.

Yang kedua — membangun tumpukan yang berfungsi dari alat yang tersedia.Ruang Neuralmengumpulkan layanan AI dengan pembayaran dalam rubel, tanpa VPN dan tanpa kartu asing. Untuk video adagenerasi video— bukan Omni Live, tapi cukup untuk sebagian besar tugas. Ditambah sebuahmengobrol dengan model multimodal, pekerjaan gambarDanalat suara.

Jika Anda secara khusus membutuhkan "Saya melihat ke kamera dan berbicara secara real time" — belum ada layanan Rusia yang memiliki format tersebut. Ini benar-benar inovasi Google. Namun jika tugasnya adalah "menganalisis materi video" atau "menghasilkan konten video", alat dalam negeri juga akan menanganinya, dan Anda dapatdaftarada sekarang tanpa VPN.

Apa yang harus dipilih tergantung pada tugasnya. Dan seberapa besar keinginan Anda untuk bermain-main dengan VPN untuk demo 20 menit.

Pertanyaan yang Sering Diajukan (FAQ)

T: Bagaimana cara mendapatkan hasil terbaik dari AI?
A: Gunakan petunjuk rinci (deskripsi) dalam bahasa Inggris; tentukan detail gaya dan pemandangan.

T: Dapatkah saya menggunakan konten ini secara komersial?
J: Ya, semua konten yang dihasilkan sepenuhnya milik Anda.