Gere vídeo fotorrealista com áudio sincronizado a partir de uma imagem ou de um comando de texto com o Grok Imagine 1.5, o modelo de vídeo em 1º lugar no ranking da Image-to-Video Arena.
1º lugar na Image-to-Video Arena
Lançado pela xAI em 31 de maio de 2026, o Grok Imagine 1.5 subiu 52 pontos de Elo em relação à versão 1.0 nos testes cegos da Arena.ai — o suficiente para passar à frente do Seedance 2.0 da ByteDance e dos concorrentes do Google e da OpenAI.
Até 12 arquivos de referência por geração
O modelo aceita quatro tipos de entrada ao mesmo tempo: até 9 imagens, até 3 trechos de vídeo (somando no máximo 15 segundos), até 3 arquivos de áudio e o seu comando de texto. Você combina o que quiser, respeitando o limite de 12 arquivos.
Áudio nativo, sem precisar montar depois
A grande novidade da versão 1.5 é o som: ambiência, ruído de sala, música e diálogo saem na mesma geração da imagem. Coloque entre aspas a fala ou o efeito sonoro que você quer e ele vem junto com o vídeo.
Rostos fotorrealistas que não mudam no meio da cena
Na 1.5 o rosto mantém a identidade ao longo de todo o plano — justamente o ponto fraco de todos os modelos anteriores. Dá para enviar a sua própria gravação de voz ou uma referência e o personagem acompanha a fala.
O Overchat AI traz para você o poder dos principais modelos de IA do mundo: GPT, Claude, Gemini, Mistral e muito mais...

O que dá para criar com o Grok Imagine 1.5? Comece por estas ideias:
Vídeo curto que já sai pronto
TikToks, Reels e Shorts em que efeito sonoro, música e narração são gerados junto com a imagem — sem passar áudio à parte, sem sincronizar na mão e sem exportar timeline.
Curta com diálogo de verdade
Escreva o roteiro, envie a imagem do personagem e o modelo gera a cena com o ator falando a fala em sincronia com os lábios. A identidade do rosto se mantém entre planos diferentes.
B-roll e vídeo explicativo para YouTube
Passagens de viagem, demonstração de produto, apoio visual de explicação, abertura em plano fechado — vídeo fotorrealista com som ambiente sincronizado, pronto para entrar na timeline ao lado do seu material.
Vídeo falado com a sua própria voz
Envie uma foto sua junto com uma gravação de voz e o Grok Imagine 1.5 anima o seu rosto dizendo a frase — sincronia labial, expressão e movimento de cabeça resolvidos na mesma geração.
Vídeo de marketing de produto
Envie fotos do produto como referência, descreva a cena e receba um anúncio acabado para a página de vendas — com o som ambiente certo e narração incluída.
Cenas fotorrealistas de cinema
Os 12 espaços de referência permitem fixar lugares, objetos e pessoas reais e combiná-los com qualquer elemento imaginário. Rostos e iluminação se mantêm coerentes do começo ao fim do plano.
Crie vídeos com o Grok Imagine 1.5 em 3 passos
Descreva sua visão
Escreva o comando e, se quiser, adicione referências — até 9 imagens, 3 trechos de vídeo, 3 faixas de áudio ou qualquer combinação até 12 arquivos.
Escolha seu estilo
O Grok Imagine 1.5 gera o vídeo com som ambiente, diálogo e música sincronizados — normalmente em menos de um minuto.
Baixe e use
Prepare seu vídeo para compartilhar, publicar ou integrar em seus projetos.
O que é o Grok Imagine 1.5?
O Grok Imagine 1.5 é o gerador de vídeo da xAI, lançado em 31 de maio de 2026. Ele transforma um comando de texto ou uma única imagem em um vídeo curto fotorrealista com áudio sincronizado — som ambiente, música e diálogo saem na mesma geração. Na data do lançamento, ocupava o 1º lugar do ranking público da Image-to-Video Arena, à frente do Seedance 2.0 da ByteDance, do Veo do Google e do HappyHorse da Alibaba.
Como usar o Grok Imagine 1.5?
Entre no Overchat AI com e-mail, Google ou Apple, abra o gerador de vídeo e escolha o Grok Imagine 1.5 na lista de modelos. Escreva o comando, anexe se quiser até 12 arquivos de referência (imagens, trechos de vídeo, faixas de áudio) e gere. O clipe costuma voltar em menos de um minuto, já com o áudio misturado. Sem chave de API, sem conta na xAI e sem instalar nada.
Qual a diferença entre o Grok Imagine 1.5 e o 1.0?
O 1.5 marca +52 pontos de Elo sobre o 1.0 nos testes cegos da Arena.ai. Os maiores ganhos estão no áudio (gerado junto, em vez de acrescentado depois), na consistência do personagem (o mesmo rosto se mantém ao longo do plano), no fotorrealismo e na sincronia labial. Na prática: o 1.0 parecia um modelo de vídeo com som colado por cima; o 1.5 parece um modelo só gerando as duas coisas.
O Grok Imagine 1.5 gera vídeo com som?
Gera — o áudio nativo é a principal novidade da versão 1.5. Escreva no comando o que você quer ouvir e coloque entre aspas o efeito sonoro ou a fala específica; o modelo gera e mistura tudo na mesma passada. Também dá para enviar o seu próprio áudio (até 3 faixas por geração) e o modelo sincroniza os lábios do personagem com a sua gravação.
Qual a duração de um vídeo do Grok Imagine 1.5?
Cada geração produz um clipe curto: o modelo é otimizado para conteúdo de alta qualidade e pouca duração, não para cenas longas. Para uma peça maior, gere vários clipes e emende: a consistência de personagem se mantém bem entre planos, então o mesmo rosto e a mesma voz atravessam os cortes. O limite de duração por clipe fica indicado na própria tela do gerador.
O Grok Imagine 1.5 é gratuito?
Não. No Overchat AI o Grok Imagine 1.5 é um modelo pago, porque gerar vídeo fotorrealista com áudio nativo custa processamento de verdade. A plataforma tem outras ferramentas gratuitas, incluindo gerador de imagens e conversa com os principais modelos de linguagem — criar a conta não custa nada, e você paga apenas pelos vídeos que gerar.