← Todos os artigos

Gemini Omni Vídeo: o que o modo de vídeo Google pode fazer em tempo real

Gemini Omni Vídeo: o que o modo de vídeo Google pode fazer em tempo real

Resumidamente sobre o principal (BLUF)

Gemini Omni — modo de vídeo Google em tempo real: aponte a câmera e a modelo explica, traduz ou analisa o que vê ao vivo. Vamos descobrir de onde veio a palavra “Omni”, o que o modelo faz com o vídeo e o que o usuário russo pode fazer com tudo isso.

Na semana passada, colegas postaram um vídeo de uma pessoa mostrando seu guarda-roupa ao vivo, e Gemini comentando as peças em tempo real e sugerindo looks. Meu primeiro pensamento: “bem, apenas mais uma demonstração que não funciona na vida real”. Pensando bem, após o teste: funciona. Não é perfeito, mas funciona.

De onde vem a palavra “Omni”?

"Omni" significa "tudo de uma vez". Tanto GPT-4o (omni) quanto Gemini agora possuem um modo onde o modelo trabalha com texto, voz, imagens e vídeo simultaneamente. Não em turnos. Não “primeiro o quadro, depois a resposta”. Apenas o fluxo.

Especificamente, Gemini Omni O vídeo pode receber uma transmissão ao vivo de uma câmera e reagir ao que está acontecendo em tempo real. Nomeie objetos. Leia o texto na tela. Responda a perguntas sobre o que está sendo mostrado no quadro neste momento.

Tecnicamente, é chamada de API Multimodal Live. O fluxo de vídeo vai para os servidores Google, o modelo o processa e responde com um atraso de 200–400 ms. Isso já parece uma conversa, não uma solicitação-resposta.

Gemini Omni: modo de vídeo de rede neural observa o mundo em tempo real

O que exatamente o modelo faz com o vídeo?

É importante distinguir entre três coisas diferentes:

  • Análise do vídeo baixado - você envia um vídeo, pede que descrevam ou encontrem o momento certo. Isso funcionou em 2024.
  • Modo em tempo real - a modelo olha pela câmera com você. Isso já é fundamentalmente diferente.
  • Geração de vídeo - aqui Google lançou o Veo 3 separadamente, esta é uma história diferente e uma ferramenta diferente.

No modo Omni Live, você pode apontar seu telefone para um painel elétrico quebrado e perguntar “o que há de errado” – e obter uma resposta quase instantaneamente, sem esperar que ele carregue. Ou mostre o prato em um restaurante e descubra a composição aproximada. Ou mostre seu código no monitor e receba imediatamente um comentário.

Caso real: desmontando código através da câmera

Um dos cenários mais viáveis ​​é transmitir a tela durante a depuração. Abra Google AI Studio, ative o modo de vídeo, mostre o IDE. Você pergunta: “por que há nulo aqui?” — o modelo vê um stacktrace específico e responde ao ponto.

Trabalhei assim com um script Python por cerca de vinte minutos. O atraso é curto, as respostas vão direto ao ponto. A única coisa é que depois de 20 minutos o telefone começou a esquentar, tive que mudar para um laptop.

Também funciona bem com documentos. Você coloca o papel na frente da câmera, faz perguntas - a modelo lê o texto e responde. Para fontes fora do padrão, às vezes comete erros, mas no geral a precisão é decente.

Onde está o problema?

Vou te contar honestamente sobre o que me incomoda.

Em primeiro lugar, o acesso. Gemini 2.0 com Omni Video reside no Google AI Studio e no aplicativo de assinatura Advanced. Há um período de teste. Então - pague. Você não pode adicionar um cartão bancário russo. A VPN é necessária não apenas para registro, mas também para operação estável do stream.

Em segundo lugar, privacidade. Quando você transmite um vídeo em Google, ele vai para algum lugar. A empresa diz “não economizamos”, mas essa é apenas a palavra deles.

Em terceiro lugar, limites de sessão. Você não pode assistir indefinidamente; existem restrições quanto à duração do fluxo. E a qualidade do trabalho cai visivelmente quando a Internet é ruim.

O que um usuário russo deve fazer?

Duas maneiras.

O primeiro é VPN + Google AI Studio. Funciona, mas com nervosismo: você precisa de uma conexão estável, um cartão não russo e, às vezes, a sessão simplesmente cai.

A segunda é montar uma pilha de trabalho com as ferramentas disponíveis. Sobre NeuralSpace serviços de IA coletados sem VPN e sem cartões monetários. Para vídeo existe geração de vídeo - não Omni Live, mas o suficiente para a maioria das tarefas. Mais converse com modelos multimodais, trabalhando com imagens, instrumentos de voz.

Se você só precisa “olhar para a câmera e se comunicar em tempo real”, nenhum dos serviços russos ainda possui esse formato. Esta é realmente uma inovação Google. Mas se a tarefa é “analisar material de vídeo” ou “gerar conteúdo de vídeo”, tanto as ferramentas nacionais como registrar Você pode fazer isso agora mesmo, sem VPN.

O que escolher depende da tarefa. E isso depende de quão disposto você está em mexer em uma VPN para fazer uma demonstração de 20 minutos.

Perguntas frequentes (FAQ)

Pergunta: Como obter o melhor resultado de uma rede neural?
Resposta: Use instruções detalhadas (descrições) em inglês, defina o estilo e os detalhes da cena.

Question: Esses materiais podem ser usados ​​para fins comerciais?
Resposta: Sim, o conteúdo gerado é inteiramente seu.