← Все статьи

Gemini Omni Video: mod video yang boleh Google lakukan dalam masa nyata

Gemini Omni Video: mod video yang boleh Google lakukan dalam masa nyata

Secara ringkas tentang perkara utama (BLUF)

Gemini Omni — mod video Google dalam masa nyata: halakan kamera, dan model menerangkan, menterjemah atau menghuraikan perkara yang dia lihat secara langsung. Mari kita fikirkan dari mana perkataan "Omni" berasal, apa yang model lakukan dengan video, dan apa yang pengguna Rusia boleh lakukan dengan semua ini.

Minggu lalu, rakan sekerja menyiarkan video seseorang menunjukkan almari pakaiannya secara langsung, dan Gemini mengulas item dalam masa nyata dan mencadangkan penampilan. Fikiran pertama saya: "baik, hanya satu lagi demo yang tidak berfungsi dalam kehidupan sebenar." Fikiran kedua, selepas ujian: ia berfungsi. Tidak sempurna, tetapi ia berfungsi.

Dari manakah perkataan "Omni" berasal?

"Omni" bermaksud "sekaligus." Kedua-dua GPT-4o (omni) dan Gemini kini mempunyai mod di mana model berfungsi dengan teks, suara, imej dan video secara serentak. Bukan bergilir-gilir. Bukan "mula-mula bingkai, kemudian jawapannya." Hanya aliran.

Khususnya, Gemini Omni Video boleh menerima strim langsung daripada kamera dan bertindak balas terhadap apa yang berlaku dalam masa nyata. Namakan objek. Baca teks pada skrin. Jawab soalan tentang perkara yang ditunjukkan dalam bingkai sekarang.

Secara teknikal ia dipanggil Multimodal Live API. Strim video pergi ke pelayan Google, model memprosesnya dan bertindak balas dengan kelewatan 200–400 ms. Ini sudah kelihatan seperti perbualan, bukan permintaan-tindak balas.

Gemini Omni: neural network video mode looks at the world in real time

Apa sebenarnya yang dilakukan model dengan video itu?

Adalah penting untuk membezakan antara tiga perkara yang berbeza:

  • Analisis video yang dimuat turun— anda memuat naik video, minta mereka menerangkan atau mencari masa yang sesuai. Ini berfungsi pada tahun 2024.
  • Mod masa nyata— model melihat melalui kamera dengan anda. Ini pada asasnya sudah berbeza.
  • Penjanaan video- di sini Google melancarkan Veo 3 secara berasingan, ini adalah cerita yang berbeza dan alat yang berbeza.

Dalam mod Omni Live, anda boleh menghalakan telefon anda ke panel elektrik yang rosak dan bertanya "apa yang salah" - dan mendapatkan jawapan hampir serta-merta, tanpa menunggu ia dimuatkan. Atau tunjukkan hidangan di restoran dan ketahui komposisi anggarannya. Atau tunjukkan kod anda pada monitor dan segera dapatkan ulasan.

Kes sebenar: membuka kod melalui kamera

Salah satu senario yang paling boleh dilaksanakan ialah menstrim skrin semasa menyahpepijat. Buka Google AI Studio, hidupkan mod video, tunjukkan IDE. Anda bertanya: "mengapa ada null di sini?" — model melihat surih tindanan tertentu dan bertindak balas kepada titik.

Saya bekerja seperti ini dengan skrip Python selama kira-kira dua puluh minit. Kelewatannya adalah singkat, jawapannya tepat sasaran. Satu-satunya perkara ialah selepas 20 minit telefon mula panas, saya terpaksa beralih ke komputer riba.

Ia juga berfungsi dengan baik dengan dokumen. Anda meletakkan kertas di hadapan kamera, bertanya soalan - model membaca teks dan jawapan. Untuk fon bukan standard ia kadangkala membuat kesilapan, tetapi secara keseluruhan ketepatannya adalah baik.

mana tangkapannya?

Saya akan memberitahu anda secara jujur ​​tentang perkara yang mengganggu saya.

Pertama, akses. Gemini 2.0 dengan Omni Video hidup dalam Google AI Studio dan apl langganan Lanjutan. Terdapat tempoh percubaan. Kemudian - bayar. Anda tidak boleh menambah kad bank Rusia. VPN diperlukan bukan sahaja untuk pendaftaran, tetapi juga untuk operasi strim yang stabil.

Kedua, privasi. Apabila anda menstrim video di Google, ia akan pergi ke suatu tempat. Syarikat itu berkata "kami tidak menyimpan," tetapi itu hanya perkataan mereka.

Ketiga, had sesi. Anda tidak boleh menonton tanpa henti; terdapat sekatan pada panjang aliran. Dan kualiti kerja menurun dengan ketara apabila Internet lemah.

Apa yang perlu dilakukan oleh pengguna Rusia?

Dua cara.

Yang pertama ialah VPN + Google AI Studio. Ia berfungsi, tetapi dengan saraf: anda memerlukan sambungan yang stabil, kad bukan Rusia, dan kadangkala sesi itu gagal.

Yang kedua ialah memasang timbunan kerja dari alat yang tersedia. hidupNeuralSpacemengumpul perkhidmatan AI tanpa VPN dan tanpa kad mata wang. Untuk video adapenjanaan video- bukan Omni Live, tetapi cukup untuk kebanyakan tugas. Tambahan pulaberbual dengan model multimodal, bekerja dengan imej, alat suara.

Jika anda hanya perlu "melihat ke dalam kamera dan berkomunikasi dalam masa nyata", tiada satu pun perkhidmatan Rusia yang mempunyai format ini. Ini benar-benar inovasi Google. Tetapi jika tugasnya adalah "untuk menganalisis bahan video" atau "untuk menjana kandungan video", kedua-dua alat domestik danmendaftarAnda boleh melakukannya di sana sekarang tanpa VPN.

Apa yang perlu dipilih bergantung pada tugas. Dan ia bergantung pada sejauh mana anda sanggup bermain-main dengan VPN demi demo selama 20 minit.

Soalan lazim (FAQ)

Soalan: Bagaimana untuk mendapatkan hasil terbaik daripada rangkaian saraf?
Jawapan: Gunakan gesaan terperinci (huraian) dalam bahasa Inggeris, tetapkan gaya dan butiran adegan.

Soalan: Bolehkah bahan ini digunakan untuk tujuan komersial?
Jawapan: Ya, kandungan yang dihasilkan adalah milik anda sepenuhnya.