Google Gemini Omni 1.1 flash: vídeos de IA ganham memória de 10 segundos, fotogramas definidos e 4k

5 min
Google Gemini Omni 1.1 flash: vídeos de IA ganham memória de 10 segundos, fotogramas definidos e 4k

A Google lançou o Gemini Omni 1.1 Flash, nova versão de geração de vídeo com IA que analisa até 10 segundos de contexto para prolongar cenas, aceita fotogramas inicial e final definidos pelo usuário e produz vídeo em até 4K. Pré-visualizações em 360p saem até 60% mais rápidas e por cerca de um terço do custo.

O Gemini Omni 1.1 Flash, nova versão do modelo de geração de vídeo da Google, analisa até 10 segundos de contexto para prolongar cenas, aceita fotogramas inicial e final definidos pelo usuário e produz vídeo em até 4K.

Como funciona o prolongamento de cenas com memória

Gerar um vídeo curto com IA tornou-se relativamente simples. O problema começa quando é preciso juntar várias cenas e fazer com que pareçam pertencer ao mesmo vídeo. É nessa consistência que a Google aposta.

O Omni 1.1 consegue analisar até 10 segundos do vídeo anterior para perceber o contexto e continuar a ação, em vez de se basear apenas no último segundo. As cenas podem ser prolongadas em blocos de 10 segundos, até um máximo acumulado de 40 segundos.

  • Análise de até 10 segundos de contexto anterior

  • Prolongamento em blocos de 10 segundos

  • Máximo acumulado de 40 segundos por cena

O que muda na prática para quem gera vídeos com IA

Para criadores que trabalham com cenas curtas e precisam de encadeamento narrativo, a memória de 10 segundos permite que um personagem mantenha a mesma roupa, o cenário não mude de iluminação bruscamente e a direção do movimento se mantenha.

Antes, cada cena precisava ser regenerada inteira do zero, o que multiplicava custos e retrabalho. Agora, prolongar em blocos de 10 segundos significa que o modelo retoma o contexto já existente em vez de recriar tudo.

Fotogramas inicial e final definidos pelo usuário

O modelo passa também a permitir indicar o primeiro e o último fotograma de uma sequência. A partir desses dois pontos, gera o vídeo intermediário. Isso pode ser útil para movimentos de câmera, zooms, transições ou vídeos concebidos para entrar em loop sem cortes visíveis.

Essa capacidade muda o fluxo criativo: em vez de descrever a cena apenas por texto, o criador entrega âncoras visuais concretas. O modelo preenche o que está entre os dois pontos, respeitando a trajetória definida.

  • Movimentos de câmera com trajetória controlada

  • Zooms e transições definidos por âncoras visuais

  • Vídeos em loop sem cortes visíveis

Referência visual de até três segundos

Outra possibilidade é usar até três segundos de vídeo como referência. A ideia é fornecer ao modelo mais informação visual para ajudar a preservar elementos como a aparência de personagens ou o ambiente entre diferentes cenas.

Na prática, isso funciona como uma memória visual curta: você grava três segundos do personagem ou do cenário e o modelo usa essa referência para manter a identidade visual nas cenas seguintes.

Pré-Visualizações em 360p: 60% mais rápidas e um terço do custo

Nem tudo precisa ser renderizado com a qualidade máxima. Para experimentar ideias e testar diferentes versões, o Omni 1.1 permite gerar pré-visualizações em 360p, até 60% mais rapidamente e por cerca de um terço do custo da geração em 720p, segundo a Google.

Depois de aprovada a versão final, o vídeo pode ser produzido em 1080p ou ampliado até 4K. Esse fluxo em dois estágios reduz desperdício: você paga caro apenas pela versão final, não pelas tentativas.

  • 360p: iteração rápida e barata

  • 720p: qualidade intermediária para validação

  • 1080p e 4K: entrega final após aprovação

Onde o Gemini Omni 1.1 flash está disponível

O Gemini Omni 1.1 Flash está disponível para programadores através da API Gemini no Google AI Studio e para empresas através da plataforma Agent Platform. Algumas funcionalidades estão também a chegar ao Google Flow para subscritores dos planos AI Plus, Pro e Ultra, enquanto a extensão de cenas será integrada na aplicação Gemini.

Isso cobre três perfis distintos: desenvolvedores que usam a API diretamente, empresas que operam na Agent Platform e usuários finais dos planos pagos do Google Flow e do app Gemini.

Impacto para o mercado brasileiro de criação de vídeo

No Brasil, criadores de conteúdo, agências e produtoras que já usam IA para vídeos publicitários, reels e protótipos ganham um argumento concreto de redução de custo e ganho de velocidade. O fluxo de 360p para iteração e 4K para entrega final tende a reduzir drasticamente o gasto com gerações descartadas.

Recursos do Gemini Omni 1.1 Flash por tipo de disponibilidade
RecursoDetalheDisponibilidade
Prolongamento de cenaAté 10s de contexto, blocos de 10s, máximo 40sAPI, empresas, app Gemini
Fotogramas inicial e finalGera o vídeo intermediárioAPI, empresas
Referência visualAté 3 segundos de vídeoAPI, empresas
Pré-visualização 360p60% mais rápida, 1/3 do custo de 720pAPI, empresas
Render final1080p ou 4KAPI, empresas

Arraste para o lado para ver toda a tabela.

Profissionais de desenvolvimento de software que integram vídeo generativo em produtos também encontram na API Gemini um caminho para gerar pré-visualizações baratas e só renderizar a versão definitiva quando o cliente aprovar.

Leia também:

Fonte: Sapo Tek

COMPARTILHAR