← Todos os artigos

Avatar interativo: como conduzir um diálogo ao vivo com um avatar em tempo real

Palco de luz: tela ao vivo com um avatar 3D amigável no microfone, ondas sonoras próximas, balão de bate-papo, botão play e ícone de sinal ao vivo

Um avatar interativo é uma sessão de streaming na seção "Avatares de vídeo": o avatar fala ao vivo a partir do seu texto ou áudio carregado, e o resultado fica imediatamente disponível via link de streaming. A diferença de um vídeo normal com avatar é fundamental: o vídeo finalizado leva minutos para ser renderizado, mas uma sessão ao vivo começa a falar em segundos, e você pode enviar um texto para ele logo durante a transmissão. Abaixo está o que é essa ferramenta, quais modos ela possui, como iniciar uma sessão e quanto custa.

O que é e quem achará útil?

Um avatar de vídeo normal é uma gravação: você define o texto, espera a renderização e obtém o arquivo finalizado. Um avatar interativo funciona de maneira diferente – como uma transmissão ao vivo. A sessão abre, o avatar começa a falar imediatamente e você controla em tempo real: enviar novas frases, parar ou fechar. Este formato é conveniente onde o momento é importante: cumprimentar um convidado em uma landing page, responder ao vivo a uma pergunta, uma breve demonstração, ensaiar um roteiro antes de gravar o vídeo final, um apresentador virtual em uma reunião ou treinamento.

O quão mais rápido o formato ao vivo é do que a geração convencional pode ser visto nas medições da plataforma: de acordo com a telemetria de 07/09/2026, um clipe 1080p de cinco segundos é renderizado em média em cerca de 115 segundos e cabe em 165 segundos em 95% dos casos. O avatar de vídeo finalizado é executado em segundo plano por minutos – de acordo com o registro de geração da plataforma, 3.304 tarefas de vídeo foram lançadas em 30 dias (3 de setembro a 2 de outubro de 2026), das quais 2.377 foram concluídas com sucesso. A sessão ao vivo não está vinculada a esta espera: ela começa imediatamente.

Três fontes de fala

A ferramenta possui três modos - escolha aquele que se adapta à tarefa:

  • Texto (roteiro). Digite o texto finalizado - o avatar lê como está. Adequado para saudações, anúncios, comentários preparados.
  • Transmissão de texto. Você define uma frase inicial e depois envia novas falas durante a sessão - o avatar continua a falar, como em um diálogo ao vivo. É conveniente quando a resposta surge em qualquer lugar.
  • Áudio. Você carrega um arquivo de áudio pronto e o avatar o repete com articulação precisa (sincronização labial). Útil se a dublagem já tiver sido gravada usando sua voz ou um clone.

Texto nos modos “Texto” e “Text Stream” – até 5.000 caracteres. A voz é selecionada em um catálogo com pesquisa e visualização: clique no botão ouvir ao lado da voz para ouvi-la antes de começar.

Seção “Avatares de vídeo” NeuralSpace, guia “Avatar interativo”: seleção de fonte “Texto / fluxo de texto / áudio”, galeria de avatar, pesquisa e visualização de voz, campo de texto, preço da sessão e botão “Iniciar sessão”

Como começar: passo a passo

  1. Abra a guia "Avatar interativo" na seção "Avatares de vídeo".
  2. Faça login: os convidados podem visualizar a seção, mas precisarão fazer login para iniciar a sessão.
  3. Selecione a fonte de fala – Texto, Fluxo de Texto ou Áudio.
  4. Selecione um avatar na galeria de imagens prontas.
  5. Para modos com texto, selecione uma voz e insira uma linha - você pode ouvir a voz primeiro.
  6. Para o modo Áudio, anexe um arquivo de áudio.
  7. Observe o preço em tokens - ele é visível antes do lançamento e é calculado de acordo com a duração da sessão.
  8. Clique em “Iniciar Sessão”. O avatar começará a falar e a sessão aparecerá no histórico.

Como gerenciar uma sessão

Uma sessão ao vivo não é um arquivo, mas sim um stream, portanto possui seu próprio status no histórico: “No ar”, “Concluído” ou “Erro”. A sessão finalizada pode ser aberta com um link de streaming e visualizada diretamente no cartão através do player integrado. No modo “Fluxo de texto”, enquanto a sessão estiver ativa, aparece um campo para envio de novas frases – desta forma a conversa continua sem reiniciar. Qualquer sessão pode ser interrompida com um botão e excluída do histórico.

Quanto custa isso

O pagamento é baseado em segundos de sessão, o bloqueio mínimo é de um minuto. O preço em tokens é mostrado antes do lançamento e é calculado usando os mesmos dados que serão baixados, portanto o valor mostrado é igual ao valor real de qualquer entrada válida. Se a sessão não for bem-sucedida, o que foi baixado é devolvido. Não há assinatura: novos usuários recebem tokens iniciais para seus primeiros testes e, em seguida, o saldo é reabastecido com a quantia necessária.

Com o que combinar

Perguntas frequentes

Qual a diferença entre um avatar interativo e um vídeo de avatar normal?

Um vídeo normal é uma gravação: o texto é definido antecipadamente, depois ocorre a renderização e você obtém um arquivo finalizado. Uma sessão ao vivo é uma transmissão: o avatar começa a falar imediatamente e o texto pode ser enviado durante a transmissão. A primeira é para o vídeo finalizado, a segunda é para diálogos e respostas no momento.

Preciso manter a aba aberta?

A sessão fica no lado do serviço e o resultado está disponível por meio de um link de streaming – você pode retornar a ela a partir do histórico. É mais conveniente enviar frases no modo “Text Stream” a partir de uma aba aberta.

Quais vozes e idiomas estão disponíveis?

As vozes são retiradas de um catálogo com filtro de idioma: podem ser pesquisadas e ouvidas antes do lançamento. O idioma da voz é selecionado separadamente do modo - você pode ler o texto no idioma desejado.

Quanto custa uma sessão?

Por segundos com bloco mínimo de um minuto; o preço em tokens é visível antes do lançamento e é igual ao preço amortizado. Não há assinatura, novos usuários recebem tokens iniciais.