← Все статьи

Gemini Omni Video: τι λειτουργία βίντεο μπορεί να κάνει η Google σε πραγματικό χρόνο

Gemini Omni Video: τι λειτουργία βίντεο μπορεί να κάνει η Google σε πραγματικό χρόνο

Εν συντομία για το κύριο πράγμα (BLUF)

Gemini Omni — λειτουργία βίντεο Google σε πραγματικό χρόνο: στρέψτε την κάμερα και το μοντέλο εξηγεί, μεταφράζει ή αναλύει αυτό που βλέπει ζωντανά. Ας καταλάβουμε από πού προήλθε η λέξη "Omni", τι κάνει το μοντέλο με το βίντεο και τι μπορεί να κάνει ο Ρώσος χρήστης με όλα αυτά.

Την περασμένη εβδομάδα, οι συνάδελφοι δημοσίευσαν ένα βίντεο με ένα άτομο να δείχνει ζωντανά την γκαρνταρόμπα του και τον Δίδυμο να σχολιάζει αντικείμενα σε πραγματικό χρόνο και να προτείνει εμφανίσεις. Η πρώτη μου σκέψη: "Λοιπόν, απλώς ένα ακόμη demo που δεν λειτουργεί στην πραγματική ζωή." Δεύτερη σκέψη, μετά από δοκιμή: λειτουργεί. Δεν είναι τέλειο, αλλά λειτουργεί.

Από πού προέρχεται η λέξη "Omni";

"Omni" σημαίνει "όλα ταυτόχρονα." Τόσο το GPT-4o (omni) όσο και το Gemini διαθέτουν πλέον μια λειτουργία όπου το μοντέλο λειτουργεί με κείμενο, φωνή, εικόνες και βίντεο ταυτόχρονα. Όχι με στροφές. Όχι «πρώτα το πλαίσιο, μετά η απάντηση». Μόνο η ροή.

Συγκεκριμένα, το Gemini Omni Video μπορεί να λάβει ζωντανή ροή από κάμερα και να αντιδρά σε αυτό που συμβαίνει σε πραγματικό χρόνο. Ονομάστε αντικείμενα. Διαβάστε το κείμενο στην οθόνη. Απαντήστε σε ερωτήσεις σχετικά με το τι εμφανίζεται στο πλαίσιο αυτήν τη στιγμή.

Τεχνικά ονομάζεται Multimodal Live API. Η ροή βίντεο πηγαίνει στους διακομιστές της Google, το μοντέλο την επεξεργάζεται και αποκρίνεται με καθυστέρηση 200–400 ms. Αυτό μοιάζει ήδη με συνομιλία, όχι αίτημα-απάντηση.

Gemini Omni: neural network video mode looks at the world in real time

Τι ακριβώς κάνει το μοντέλο με το βίντεο;

Είναι σημαντικό να γίνει διάκριση μεταξύ τριών διαφορετικών πραγμάτων:

  • Ανάλυση βίντεο που κατεβάσατε— ανεβάζετε ένα βίντεο, τους ζητάτε να σας περιγράψουν ή να βρείτε την κατάλληλη στιγμή. Αυτό λειτούργησε το 2024.
  • Λειτουργία σε πραγματικό χρόνο— το μοντέλο κοιτάζει μέσα από την κάμερα μαζί σας. Αυτό είναι ήδη θεμελιωδώς διαφορετικό.
  • Δημιουργία βίντεο- εδώ η Google κυκλοφόρησε το Veo 3 ξεχωριστά, αυτή είναι μια διαφορετική ιστορία και ένα διαφορετικό εργαλείο.

Στη λειτουργία Omni Live, μπορείτε να δείξετε το τηλέφωνό σας σε έναν σπασμένο ηλεκτρικό πίνακα και να ρωτήσετε "τι συμβαίνει" - και να λάβετε μια απάντηση σχεδόν αμέσως, χωρίς να περιμένετε να φορτώσει. Ή δείξτε το πιάτο σε ένα εστιατόριο και μάθετε την κατά προσέγγιση σύνθεση. Ή δείξτε τον κωδικό σας στην οθόνη και λάβετε αμέσως ένα σχόλιο.

Πραγματική περίπτωση: αποσυναρμολόγηση κώδικα μέσω της κάμερας

Ένα από τα πιο εφαρμόσιμα σενάρια είναι η ροή της οθόνης κατά την αποσφαλμάτωση. Ανοίξτε το Google AI Studio, ενεργοποιήστε τη λειτουργία βίντεο, εμφανίστε το IDE. Ρωτάτε: "γιατί υπάρχει μηδενικό εδώ;" — το μοντέλο βλέπει ένα συγκεκριμένο stacktrace και ανταποκρίνεται στο σημείο.

Δούλεψα έτσι με ένα σενάριο Python για περίπου είκοσι λεπτά. Η καθυστέρηση είναι μικρή, οι απαντήσεις είναι επί της ουσίας. Το μόνο πράγμα είναι ότι μετά από 20 λεπτά το τηλέφωνο άρχισε να ζεσταίνεται, έπρεπε να αλλάξω ένα φορητό υπολογιστή.

Λειτουργεί επίσης καλά με έγγραφα. Βάζεις το χαρτί μπροστά στην κάμερα, κάνεις ερωτήσεις - το μοντέλο διαβάζει το κείμενο και απαντά. Για τις μη τυπικές γραμματοσειρές μερικές φορές κάνει λάθη, αλλά συνολικά η ακρίβεια είναι αξιοπρεπής.

Πού είναι το αλιεύμα;

Θα σας πω ειλικρινά για αυτό που με ενοχλεί.

Πρώτον, πρόσβαση. Το Gemini 2.0 με το Omni Video ζει στο Google AI Studio και στην εφαρμογή συνδρομής Advanced. Υπάρχει δοκιμαστική περίοδος. Στη συνέχεια - πληρώστε. Δεν μπορείτε να προσθέσετε ρωσική τραπεζική κάρτα. Το VPN χρειάζεται όχι μόνο για εγγραφή, αλλά και για σταθερή λειτουργία του stream.

Δεύτερον, ιδιωτικότητα. Όταν κάνετε ροή ενός βίντεο στο Google, αυτό πηγαίνει κάπου. Η εταιρεία λέει «δεν κάνουμε οικονομία», αλλά αυτή είναι μόνο η λέξη της.

Τρίτον, όρια συνεδρίας. Δεν μπορείτε να παρακολουθείτε ατελείωτα. υπάρχουν περιορισμοί στο μήκος του ρέματος. Και η ποιότητα της εργασίας πέφτει αισθητά όταν το Διαδίκτυο είναι φτωχό.

Τι πρέπει να κάνει ένας Ρώσος χρήστης;

Δύο τρόποι.

Το πρώτο είναι το VPN + Google AI Studio. Λειτουργεί, αλλά με νεύρα: χρειάζεστε μια σταθερή σύνδεση, μια μη ρωσική κάρτα και μερικές φορές η συνεδρία απλώς πέφτει.

Το δεύτερο είναι να συναρμολογήσετε μια στοίβα εργασίας από διαθέσιμα εργαλεία. ΕπίNeuralSpaceσυνέλεξε υπηρεσίες AI χωρίς VPN και χωρίς κάρτες συναλλάγματος. Για βίντεο υπάρχειδημιουργία βίντεο- όχι Omni Live, αλλά αρκετά για τις περισσότερες εργασίες. Συνσυνομιλία με πολυτροπικά μοντέλα, εργασία με εικόνες, όργανα φωνής.

Εάν χρειάζεστε απλώς "κοιτάξτε την κάμερα και επικοινωνήστε σε πραγματικό χρόνο", καμία από τις ρωσικές υπηρεσίες δεν έχει ακόμη αυτήν τη μορφή. Αυτή είναι πραγματικά μια καινοτομία Google. Αλλά αν το καθήκον είναι «να αναλύσουμε υλικό βίντεο» ή «να δημιουργήσουμε περιεχόμενο βίντεο», τόσο εγχώρια εργαλεία όσο καιμητρώοΜπορείτε να το κάνετε εκεί αυτήν τη στιγμή χωρίς VPN.

Τι να επιλέξετε εξαρτάται από την εργασία. Και εξαρτάται από το πόσο διατεθειμένοι είστε να ασχοληθείτε με ένα VPN για χάρη μιας επίδειξης 20 λεπτών.

Συχνές ερωτήσεις (FAQ)

Ερώτηση: Πώς να έχετε το καλύτερο αποτέλεσμα από ένα νευρωνικό δίκτυο;
Απάντηση: Χρησιμοποιήστε λεπτομερείς προτροπές (περιγραφές) στα Αγγλικά, ορίστε το στυλ και τις λεπτομέρειες της σκηνής.

Ερώτηση: Μπορούν αυτά τα υλικά να χρησιμοποιηθούν για εμπορικούς σκοπούς;
Απάντηση: Ναι, το περιεχόμενο που δημιουργείται είναι εξ ολοκλήρου δικό σας.