← Все статьи

Video Gemini Omni: mode video apa yang dapat dilakukan Google secara real-time

Video Gemini Omni: mode video apa yang dapat dilakukan Google secara real-time

Secara singkat tentang hal utama (BLUF)

Gemini Omni — mode video Google secara real time: arahkan kamera, dan model menjelaskan, menerjemahkan, atau menguraikan apa yang dilihatnya secara langsung. Mari kita cari tahu dari mana kata “Omni” berasal, apa yang dilakukan model tersebut terhadap video, dan apa yang dapat dilakukan pengguna Rusia dengan semua ini.

Minggu lalu, rekan-rekannya memposting video seseorang yang memperlihatkan lemari pakaiannya secara langsung, dan Gemini mengomentari item secara real time dan menyarankan penampilan. Pikiran pertama saya: "ya, hanya demo lain yang tidak berfungsi di kehidupan nyata." Pemikiran kedua, setelah pengujian: berhasil. Tidak sempurna, tapi berhasil.

Dari mana asal kata "Omni"?

"Omni" berarti "sekaligus". Baik GPT-4o (omni) dan Gemini kini memiliki mode di mana model bekerja dengan teks, suara, gambar, dan video secara bersamaan. Tidak secara bergantian. Bukan “pertama bingkainya, baru jawabannya”. Hanya alirannya.

Secara khusus, Gemini Omni Video dapat menerima streaming langsung dari kamera dan bereaksi terhadap apa yang terjadi secara real time. Beri nama objek. Membaca teks di layar. Jawab pertanyaan tentang apa yang ditampilkan dalam bingkai saat ini.

Secara teknis ini disebut Multimodal Live API. Aliran video masuk ke server Google, model memprosesnya dan merespons dengan penundaan 200–400 ms. Ini sudah tampak seperti percakapan, bukan permintaan-tanggapan.

Gemini Omni: neural network video mode looks at the world in real time

Apa sebenarnya yang dilakukan model terhadap video tersebut?

Penting untuk membedakan tiga hal berbeda:

  • Analisis video yang diunduh— Anda mengunggah video, minta mereka mendeskripsikan atau menemukan momen yang tepat. Ini berhasil pada tahun 2024.
  • Modus waktu nyata— model melihat melalui kamera bersama Anda. Ini sudah berbeda secara mendasar.
  • Pembuatan video- di sini Google meluncurkan Veo 3 secara terpisah, ini adalah cerita yang berbeda dan alat yang berbeda.

Dalam mode Omni Live, Anda dapat mengarahkan ponsel Anda ke panel listrik yang rusak dan bertanya "ada apa" - dan mendapatkan jawaban hampir seketika, tanpa menunggu hingga memuatnya. Atau tunjukkan hidangan tersebut di restoran dan cari tahu perkiraan komposisinya. Atau tunjukkan kode Anda di monitor dan segera dapatkan komentar.

Kasus nyata: membongkar kode melalui kamera

Salah satu skenario yang paling bisa diterapkan adalah melakukan streaming layar saat melakukan debug. Buka Google AI Studio, aktifkan mode video, tampilkan IDE. Anda bertanya: “mengapa ada nol di sini?” — model melihat stacktrace tertentu dan merespons poin tersebut.

Saya bekerja seperti ini dengan skrip Python selama sekitar dua puluh menit. Penundaannya singkat, jawabannya langsung pada sasaran. Satu-satunya hal adalah setelah 20 menit ponsel mulai memanas, saya harus beralih ke laptop.

Ini juga berfungsi baik dengan dokumen. Anda meletakkan kertas di depan kamera, mengajukan pertanyaan - model membaca teks dan menjawab. Untuk font non standar kadang ada kesalahan, tapi secara keseluruhan akurasinya lumayan.

Di mana hasil tangkapannya?

Saya akan memberitahu Anda dengan jujur ​​​​tentang apa yang mengganggu saya.

Pertama, akses. Gemini 2.0 dengan Omni Video ada di Google AI Studio dan aplikasi berlangganan Lanjutan. Ada masa percobaan. Lalu - bayar. Anda tidak dapat menambahkan kartu bank Rusia. VPN diperlukan tidak hanya untuk registrasi, tetapi juga untuk pengoperasian streaming yang stabil.

Kedua, privasi. Saat Anda melakukan streaming video di Google, video itu pergi ke suatu tempat. Perusahaan mengatakan “kami tidak menabung,” tapi itu hanya kata-kata mereka.

Ketiga, batasan sesi. Anda tidak dapat menonton tanpa henti; ada batasan panjang aliran. Dan kualitas pekerjaan menurun drastis ketika Internet buruk.

Apa yang harus dilakukan pengguna Rusia?

Dua cara.

Yang pertama adalah VPN + Google AI Studio. Ini berfungsi, tetapi dengan gugup: Anda memerlukan koneksi yang stabil, kartu non-Rusia, dan terkadang sesinya terhenti.

Yang kedua adalah merakit tumpukan kerja dari alat yang tersedia. PadaRuang Neuralmengumpulkan layanan AI tanpa VPN dan tanpa kartu mata uang. Untuk video adagenerasi video- bukan Omni Live, tapi cukup untuk sebagian besar tugas. Plusmengobrol dengan model multimodal, bekerja dengan gambar, instrumen suara.

Jika Anda hanya perlu “melihat ke kamera dan berkomunikasi secara real time”, belum ada layanan Rusia yang memiliki format ini. Ini benar-benar sebuah inovasi Google. Namun jika tugasnya adalah “menganalisis materi video” atau “menghasilkan konten video”, baik alat dalam negeri maupundaftarAnda dapat melakukannya di sana sekarang tanpa VPN.

Apa yang harus dipilih tergantung pada tugasnya. Dan itu tergantung pada seberapa ingin Anda mengutak-atik VPN demi demo 20 menit.

Pertanyaan yang sering diajukan (FAQ)

Pertanyaan: Bagaimana cara mendapatkan hasil terbaik dari jaringan saraf?
Jawaban: Gunakan petunjuk rinci (deskripsi) dalam bahasa Inggris, atur gaya dan detail adegan.

Pertanyaan: Apakah bahan-bahan ini dapat digunakan untuk tujuan komersial?
Jawaban: Ya, konten yang dihasilkan sepenuhnya milik Anda.