← सभी लेख

Gemini Omni वीडियो: वीडियो मोड Google वास्तविक समय में क्या कर सकता है

Gemini Omni वीडियो: वीडियो मोड Google वास्तविक समय में क्या कर सकता है

मुख्य बात के बारे में संक्षेप में (BLUF)

Gemini Omni - वीडियो मोड Google वास्तविक समय में: कैमरे को इंगित करें, और मॉडल जो कुछ भी लाइव देखती है उसे समझाती है, अनुवाद करती है या पार्स करती है। आइए जानें कि "ओमनी" शब्द कहां से आया, मॉडल वीडियो के साथ क्या करता है और रूसी उपयोगकर्ता इस सब के साथ क्या कर सकता है।

पिछले हफ्ते, सहकर्मियों ने एक व्यक्ति का वीडियो पोस्ट किया था जिसमें वह अपनी अलमारी को लाइव दिखा रहा था, और Gemini वास्तविक समय में वस्तुओं पर टिप्पणी कर रहा था और लुक का सुझाव दे रहा था। मेरा पहला विचार: "ठीक है, बस एक और डेमो जो वास्तविक जीवन में काम नहीं करता है।" दूसरा विचार, परीक्षण के बाद: यह काम करता है। पूर्ण तो नहीं, लेकिन यह काम करता है।

"ओमनी" शब्द कहाँ से आया है?

"ओमनी" का अर्थ है "एक ही बार में।" GPT-4o (ओमनी) और Gemini दोनों में अब एक मोड है जहां मॉडल टेक्स्ट, आवाज, छवियों और वीडियो के साथ एक साथ काम करता है। बारी-बारी से नहीं. नहीं "पहले फ़्रेम, फिर उत्तर।" बस प्रवाह.

विशेष रूप से, Gemini Omni वीडियो कैमरे से लाइव स्ट्रीम प्राप्त कर सकता है और वास्तविक समय में क्या हो रहा है उस पर प्रतिक्रिया कर सकता है। वस्तुओं को नाम दें. स्क्रीन पर टेक्स्ट पढ़ें. इस समय फ़्रेम में क्या दिखाया जा रहा है, इसके बारे में प्रश्नों के उत्तर दें।

तकनीकी रूप से इसे मल्टीमॉडल लाइव एपीआई कहा जाता है। वीडियो स्ट्रीम Google सर्वर पर जाती है, मॉडल इसे संसाधित करता है और 200-400 एमएस की देरी से प्रतिक्रिया देता है। यह पहले से ही एक वार्तालाप जैसा दिखता है, अनुरोध-प्रतिक्रिया नहीं।

Gemini Omni: न्यूरल नेटवर्क वीडियो मोड वास्तविक समय में दुनिया को देखता है

मॉडल वास्तव में वीडियो के साथ क्या करता है?

तीन अलग-अलग चीजों के बीच अंतर करना महत्वपूर्ण है:

  • डाउनलोड किए गए वीडियो का विश्लेषण — आप एक वीडियो अपलोड करें, उनसे वर्णन करने या सही क्षण ढूंढने के लिए कहें। इसने 2024 में काम किया।
  • वास्तविक समय मोड - मॉडल आपके साथ कैमरे में देखती है। यह पहले से ही मौलिक रूप से भिन्न है।
  • वीडियो पीढ़ी - यहां Google ने Veo 3 को अलग से लॉन्च किया, यह एक अलग कहानी और एक अलग टूल है।

ओमनी लाइव मोड में, आप अपने फोन को टूटे हुए विद्युत पैनल पर इंगित कर सकते हैं और पूछ सकते हैं कि "क्या गड़बड़ है" - और इसके लोड होने की प्रतीक्षा किए बिना, लगभग तुरंत उत्तर प्राप्त करें। या किसी रेस्तरां में पकवान दिखाएं और अनुमानित संरचना का पता लगाएं। या मॉनिटर पर अपना कोड दिखाएं और तुरंत टिप्पणी प्राप्त करें।

वास्तविक मामला: कैमरे के माध्यम से कोड को अलग करना

डिबगिंग के दौरान स्क्रीन को स्ट्रीम करना सबसे व्यावहारिक परिदृश्यों में से एक है। Google AI स्टूडियो खोलें, वीडियो मोड चालू करें, IDE दिखाएं। आप पूछते हैं: "यहाँ शून्य क्यों है?" - मॉडल एक विशिष्ट स्टैकट्रेस देखता है और बिंदु पर प्रतिक्रिया करता है।

मैंने लगभग बीस मिनट तक पायथन स्क्रिप्ट के साथ इस तरह काम किया। विलंब कम है, उत्तर सटीक हैं। बात सिर्फ इतनी है कि 20 मिनट बाद फोन गर्म होने लगा तो मुझे लैपटॉप पर स्विच करना पड़ा।

यह दस्तावेज़ों के साथ भी अच्छा काम करता है। आप पेपर को कैमरे के सामने रखें, प्रश्न पूछें - मॉडल पाठ पढ़ता है और उत्तर देता है। गैर-मानक फ़ॉन्ट के लिए यह कभी-कभी गलतियाँ करता है, लेकिन कुल मिलाकर सटीकता अच्छी है।

पकड़ कहाँ है?

मैं आपको ईमानदारी से बताऊंगा कि मुझे क्या परेशान करता है।

सबसे पहले, पहुँच. Gemini 2.0 ओमनी वीडियो के साथ Google एआई स्टूडियो और उन्नत सदस्यता ऐप में रहता है। एक परीक्षण अवधि है. फिर - भुगतान करें. आप रूसी बैंक कार्ड नहीं जोड़ सकते. वीपीएन की आवश्यकता न केवल पंजीकरण के लिए, बल्कि स्ट्रीम के स्थिर संचालन के लिए भी है।

दूसरा, गोपनीयता. जब आप किसी वीडियो को Google में स्ट्रीम करते हैं, तो वह कहीं चला जाता है। कंपनी कहती है, "हम बचत नहीं करते," लेकिन यह सिर्फ उनका शब्द है।

तीसरा, सत्र सीमा. आप अंतहीन रूप से नहीं देख सकते; धारा की लंबाई पर प्रतिबंध हैं। और इंटरनेट ख़राब होने पर काम की गुणवत्ता काफ़ी गिर जाती है।

एक रूसी उपयोगकर्ता को क्या करना चाहिए?

दो रास्ते हैं।

पहला है वीपीएन + Google एआई स्टूडियो। यह काम करता है, लेकिन घबराहट के साथ: आपको एक स्थिर कनेक्शन, एक गैर-रूसी कार्ड की आवश्यकता होती है, और कभी-कभी सत्र समाप्त हो जाता है।

दूसरा उपलब्ध उपकरणों से एक कार्यशील स्टैक को इकट्ठा करना है। पर न्यूरलस्पेस बिना वीपीएन और बिना मुद्रा कार्ड के एआई सेवाएं एकत्र कीं। वीडियो के लिए वहाँ है वीडियो पीढ़ी - ओमनी लाइव नहीं, लेकिन अधिकांश कार्यों के लिए पर्याप्त है। प्लस मल्टीमॉडल मॉडल के साथ चैट करें, छवियों के साथ काम करना, ध्वनि यंत्र.

यदि आपको बस "कैमरे में देखने और वास्तविक समय में संवाद करने" की आवश्यकता है, तो किसी भी रूसी सेवा में अभी तक यह प्रारूप नहीं है। यह वास्तव में एक नवाचार है Google। लेकिन यदि कार्य "वीडियो सामग्री का विश्लेषण करना" या "वीडियो सामग्री उत्पन्न करना" है, तो घरेलू उपकरण और दोनों पंजीकरण करवाना आप इसे अभी वीपीएन के बिना भी वहां कर सकते हैं।

क्या चुनना है यह कार्य पर निर्भर करता है। और यह इस बात पर निर्भर करता है कि आप 20 मिनट के डेमो के लिए वीपीएन के साथ छेड़छाड़ करने के लिए कितने इच्छुक हैं।

अक्सर पूछे जाने वाले प्रश्न (FAQ)

प्रश्न: तंत्रिका नेटवर्क से सर्वोत्तम परिणाम कैसे प्राप्त करें?
उत्तर: अंग्रेजी में विस्तृत संकेतों (विवरण) का उपयोग करें, दृश्य की शैली और विवरण निर्धारित करें।

प्रश्न: क्या इन सामग्रियों का उपयोग व्यावसायिक उद्देश्यों के लिए किया जा सकता है?
उत्तर: हाँ, उत्पन्न सामग्री पूरी तरह से आपकी है।