→ כל המאמרים

Gemini Omni Video: מה מצב הווידאו בזמן אמת של גוגל יכול לעשות

Gemini Omni Video: מה מצב הווידאו בזמן אמת של גוגל יכול לעשות

הגרסה הקצרה (BLUF)

Gemini Omni הוא מצב הווידאו בזמן אמת של גוגל: כוון את המצלמה, והדגם מסביר, מתרגם או מנקה את מה שהוא רואה בשידור חי. מאיפה מגיעה המילה "אומני", מה הדגם עושה עם וידאו, ומה צריך לדעת משתמש רוסי.

בשבוע שעבר עמית שלח לי סרטון - מישהו מראה את המלתחה שלו בשידור חי בזמן שתאומים מעירים על הבגדים בזמן אמת ומציעים תלבושות. מחשבה ראשונה: "עוד הדגמה שלא עובדת בחיים האמיתיים". מחשבה שנייה, לאחר בדיקה: זה עובד. לא בצורה מושלמת, אבל זה עובד.

Gemini Omni Live mode: the model watches a camera feed in real time and answers questions about what is in the frame, latency around 300 ms

מאיפה באה המילה "אומני".

"אומני" פירושו "בבת אחת". בדיוק כמו GPT-4o (omni), ל-Gemini יש כעת מצב שבו הדגם עובד עם טקסט, קול, תמונות ווידאו בו זמנית. לא בזה אחר זה. לא "מסגר קודם, ענה אחר כך". בתור נחל.

באופן ספציפי, Gemini Omni Video יכול לצלם הזנת מצלמה חיה ולהגיב למה שקורה בזמן אמת. שם אובייקטים. קרא טקסט על המסך. ענה על שאלות לגבי מה שנמצא במסגרת כרגע.

מבחינה טכנית זהו Multimodal Live API. זרם הווידאו עובר לשרתים של גוגל, המודל מעבד אותו ומשיב בהשהייה של 200-400 אלפיות השנייה. זה כבר מרגיש כמו שיחה, לא בקשה ותגובה.

מה בעצם הדגם עושה עם וידאו

כדאי להפריד בין שלושה דברים שונים:

  • ניתוח סרטון שהועלה- אתה מכניס קליפ ומבקש ממנו לתאר את הצילומים או למצוא רגע מסוים. זה עבד כבר ב-2024.
  • מצב בזמן אמת— הדוגמנית צופה דרך המצלמה יחד איתך. זה שונה מהותית.
  • יצירת וידאו- כאן גוגל השיקה את Veo 3 בנפרד; זה עוד סיפור ועוד כלי.

במצב Omni Live אתה יכול לכוון את הטלפון שלך אל לוח חשמל שבור ולשאול "מה לא בסדר" - ולקבל תשובה כמעט מיידית, ללא המתנה להעלאה. או להראות מנה במסעדה ולמד את החומרים הגסים שלה. או הצג את הקוד על המסך שלך וקבל משוב מיד.

Honest comparison for a user in Russia: Gemini Omni Live needs a VPN and a foreign card; NeuralSpace works in rubles without a VPN for analyzing and generating video

מקרה אמיתי: ניפוי קוד דרך המצלמה

אחד התרחישים המעשיים ביותר הוא הזרמת המסך שלך בזמן ניפוי באגים. פתח את Google AI Studio, הפעל את מצב הווידאו, הראה את ה-IDE שלך. שאל: "למה זה בטל כאן?" - המודל רואה את עקבות הערימה בפועל ועונה לעניין.

עבדתי ככה עם סקריפט של Python במשך כעשרים דקות. זמן אחזור נמוך, תשובות נקודתיות. המלכוד היחיד - אחרי 20 דקות הטלפון התחיל להתחמם, אז עברתי למחשב נייד.

זה גם עובד טוב עם מסמכים. שים דף נייר מול המצלמה, שאל שאלות - הדוגמנית קוראת את הטקסט ועונה. לפעמים זה מקל על גופנים יוצאי דופן, אבל הדיוק הוא הגון בסך הכל.

איפה המלכוד

תן לי להיות כנה לגבי מה שמעצבן.

ראשית - גישה. Gemini 2.0 עם Omni Video חי ב-Google AI Studio ובאפליקציה עם המנוי המתקדם. יש משפט. אחרי זה - אתה משלם. אתה לא יכול להוסיף כרטיס בנק רוסי. יש צורך ב-VPN לא רק כדי להירשם, אלא כדי שהזרם יפעל ביציבות.

שנית - פרטיות. כאשר אתה מזרים וידאו לגוגל, זה הולך לאנשהו. החברה אומרת "אנחנו לא מאחסנים את זה", אבל אתה לוקח את זה באמון.

שלישית - מגבלות הפעלה. אתה לא יכול לצפות לנצח; יש מגבלות על אורך הזרם. והאיכות יורדת באופן ניכר בחיבור לקוי.

מה משתמש רוסי צריך לעשות

שני שבילים.

הראשון - VPN + Google AI Studio. זה עובד, אבל עם כאבי ראש: אתה צריך חיבור יציב, כרטיס לא רוסי, ולפעמים הפגישה פשוט יורדת.

השני - בנה ערימת עבודה מכלים זמינים.NeuralSpaceאוסף שירותי AI עם תשלום ברובל, ללא VPN וללא כרטיסים זרים. לווידאו ישיצירת וידאו- לא Omni Live, אבל מספיק עבור רוב המשימות. בנוסף אצ'אט עם מודלים מולטי-מודאליים, עבודת תדמיתוכלים קוליים.

אם אתה צריך "אני מסתכל לתוך המצלמה ומדבר בזמן אמת" - לאף שירות רוסי אין עדיין את הפורמט הזה. זה באמת החידוש של גוגל. אבל אם המשימה היא "לנתח חומר וידאו" או "ליצור תוכן וידאו", גם כלים מקומיים מטפלים בזה, ותוכלולִרְשׁוֹםשם כרגע בלי VPN.

מה לבחור תלוי במשימה. ועל כמה אתה מוכן להתעסק עם VPN עבור הדגמה של 20 דקות.

שאלות נפוצות (שאלות נפוצות)

ש: איך אני משיג את התוצאה הטובה ביותר מה-AI?
ת: השתמש בהנחיות מפורטות (תיאורים) באנגלית; ציין סגנון ופרטי סצנה.

ש: האם אני יכול להשתמש בתוכן זה באופן מסחרי?
ת: כן, כל התוכן שנוצר שייך לחלוטין לך.