O Gemini Omni 1.1 Flash, nova versão do modelo de geração de vídeo da Google, analisa até 10 segundos de contexto para prolongar cenas, aceita fotogramas inicial e final definidos pelo usuário e produz vídeo em até 4K.
Memória de 10 segundos para prolongar cenas com contexto real, até 40 segundos acumulados
Fotogramas inicial e final definidos pelo usuário geram o vídeo intermediário
Leia também
Google inaugura Centro de Engenharia no IPT: o que muda para o mercado de TI em SP
Referência visual de até 3 segundos preserva aparência de personagens e ambientes
Pré-visualizações em 360p saem até 60% mais rápidas e por cerca de um terço do custo da geração em 720p
Como funciona o prolongamento de cenas com memória
Gerar um vídeo curto com IA tornou-se relativamente simples. O problema começa quando é preciso juntar várias cenas e fazer com que pareçam pertencer ao mesmo vídeo. É nessa consistência que a Google aposta.
O Omni 1.1 consegue analisar até 10 segundos do vídeo anterior para perceber o contexto e continuar a ação, em vez de se basear apenas no último segundo. As cenas podem ser prolongadas em blocos de 10 segundos, até um máximo acumulado de 40 segundos.
Análise de até 10 segundos de contexto anterior
Prolongamento em blocos de 10 segundos
Máximo acumulado de 40 segundos por cena
O que muda na prática para quem gera vídeos com IA
Para criadores que trabalham com cenas curtas e precisam de encadeamento narrativo, a memória de 10 segundos permite que um personagem mantenha a mesma roupa, o cenário não mude de iluminação bruscamente e a direção do movimento se mantenha.
Antes, cada cena precisava ser regenerada inteira do zero, o que multiplicava custos e retrabalho. Agora, prolongar em blocos de 10 segundos significa que o modelo retoma o contexto já existente em vez de recriar tudo.
Fotogramas inicial e final definidos pelo usuário
O modelo passa também a permitir indicar o primeiro e o último fotograma de uma sequência. A partir desses dois pontos, gera o vídeo intermediário. Isso pode ser útil para movimentos de câmera, zooms, transições ou vídeos concebidos para entrar em loop sem cortes visíveis.
Essa capacidade muda o fluxo criativo: em vez de descrever a cena apenas por texto, o criador entrega âncoras visuais concretas. O modelo preenche o que está entre os dois pontos, respeitando a trajetória definida.
Movimentos de câmera com trajetória controlada
Zooms e transições definidos por âncoras visuais
Vídeos em loop sem cortes visíveis
Referência visual de até três segundos
Outra possibilidade é usar até três segundos de vídeo como referência. A ideia é fornecer ao modelo mais informação visual para ajudar a preservar elementos como a aparência de personagens ou o ambiente entre diferentes cenas.
Na prática, isso funciona como uma memória visual curta: você grava três segundos do personagem ou do cenário e o modelo usa essa referência para manter a identidade visual nas cenas seguintes.
Pré-Visualizações em 360p: 60% mais rápidas e um terço do custo
Nem tudo precisa ser renderizado com a qualidade máxima. Para experimentar ideias e testar diferentes versões, o Omni 1.1 permite gerar pré-visualizações em 360p, até 60% mais rapidamente e por cerca de um terço do custo da geração em 720p, segundo a Google.
Depois de aprovada a versão final, o vídeo pode ser produzido em 1080p ou ampliado até 4K. Esse fluxo em dois estágios reduz desperdício: você paga caro apenas pela versão final, não pelas tentativas.
360p: iteração rápida e barata
720p: qualidade intermediária para validação
1080p e 4K: entrega final após aprovação
Onde o Gemini Omni 1.1 flash está disponível
O Gemini Omni 1.1 Flash está disponível para programadores através da API Gemini no Google AI Studio e para empresas através da plataforma Agent Platform. Algumas funcionalidades estão também a chegar ao Google Flow para subscritores dos planos AI Plus, Pro e Ultra, enquanto a extensão de cenas será integrada na aplicação Gemini.
Isso cobre três perfis distintos: desenvolvedores que usam a API diretamente, empresas que operam na Agent Platform e usuários finais dos planos pagos do Google Flow e do app Gemini.
Impacto para o mercado brasileiro de criação de vídeo
No Brasil, criadores de conteúdo, agências e produtoras que já usam IA para vídeos publicitários, reels e protótipos ganham um argumento concreto de redução de custo e ganho de velocidade. O fluxo de 360p para iteração e 4K para entrega final tende a reduzir drasticamente o gasto com gerações descartadas.
| Recurso | Detalhe | Disponibilidade |
|---|---|---|
| Prolongamento de cena | Até 10s de contexto, blocos de 10s, máximo 40s | API, empresas, app Gemini |
| Fotogramas inicial e final | Gera o vídeo intermediário | API, empresas |
| Referência visual | Até 3 segundos de vídeo | API, empresas |
| Pré-visualização 360p | 60% mais rápida, 1/3 do custo de 720p | API, empresas |
| Render final | 1080p ou 4K | API, empresas |
Arraste para o lado para ver toda a tabela.
Profissionais de desenvolvimento de software que integram vídeo generativo em produtos também encontram na API Gemini um caminho para gerar pré-visualizações baratas e só renderizar a versão definitiva quando o cliente aprovar.
Leia também:
Aprenda Gemini 25 Flash Curso Gratuito De Ia Para Otimizar Seu Fluxo Visual
Cada Funcionário Poderá Gerenciar 200 Agentes De Ia Ate Como Se Preparar
Apenas 300 Tokens Certos Vencem 100k Ruins A Nova Arquitetura Da Engenharia De Contexto Para Ia
Fonte: Sapo Tek