A geração de vídeo com IA talvez nunca mais seja a mesma, porque a Kling AI lançou um modelo que, para vídeo, alcança o que o Opus 4.5 alcançou para programação: liberdade total para criar qualquer coisa.
A Kling AI apresentou o VIDEO O1, o primeiro modelo de vídeo multimodal unificado do mundo. Ele está transformando a maneira como você produz vídeo com IA.
Diferente de tudo o que já vimos, você pode experimentar uma versão inicial na Overchat AI enquanto continuamos adicionando recursos para dar conta de todo o poder do modelo.
O Kling VIDEO O1 é o primeiro modelo de vídeo multimodal unificado com IA — ele aceita qualquer tipo de entrada (texto, imagens, vídeos, keyframes, referências ou qualquer combinação) e dá conta de fluxos de trabalho que outros modelos não conseguem, como referência-e-texto-para-keyframe-para-vídeo.
Você pode misturar elementos de vários vídeos em um único prompt — por exemplo, pegar um personagem do vídeo 1, o movimento de câmera do vídeo 2, jogar tudo no vídeo 3 e mudar o estilo para pixel art, tudo em uma só geração.
O sistema de referência tudo-em-um resolve o problema de consistência, fixando personagens, objetos e cenários ao longo dos quadros e lidando com vários personagens de forma independente em cenas de grupo.
O Kling o1 permite alterar muitas coisas de uma vez em um único prompt (adicionar um personagem + trocar o fundo + mudar o estilo), substituindo os fluxos lineares do Comfy UI / FAL que encadeiam vários modelos e cobram a cada etapa.
A duração do vídeo é livremente ajustável entre 3 e 10 segundos, para você controlar o ritmo da narrativa.
Na avaliação interna da Kling AI, o o1 atingiu uma taxa de vitória de 247% sobre o recurso Ingredients to Video do Google Veo 3.1 em tarefas de referência por imagem e de 230% sobre o Runway Aleph em tarefas de transformação.
Os casos de uso profissionais vão do cinema com IA (consistência de personagens e objetos via Element Library) à publicidade (substituindo gravações tradicionais), passando pela moda (passarelas virtuais) e pela pós-produção (instruções em linguagem natural no lugar de tracking e máscaras).
A tecnologia por trás disso: um Transformer multimodal com Contexto Longo Multimodal, um novo formato chamado Multimodal Visual Language (MVL) que combina sinais de texto, visuais e de áudio dentro do Transformer, e raciocínio Chain-of-Thought integrado para resultados realistas.
Disponível pela nova interface criativa da Kling e na Overchat AI, para um acesso descomplicado.
A contrapartida: uma curva de aprendizado mais íngreme do que a do Sora 2 ou do Veo 3.1, porque há muitos recursos para entender — mas, depois que você domina, ele substitui por completo fluxos de trabalho caros com várias ferramentas.
O que é o Kling VIDEO O1?
O Kling VIDEO O1 é o primeiro modelo de geração de vídeo com IA capaz de pegar qualquer referência de qualquer entrada e aplicá-la a qualquer cena. Em essência, esse modelo aceita qualquer informação como referência e dá conta de todos os tipos de geração:
Texto para vídeo
Imagem para vídeo
Vídeo para vídeo
Keyframe para vídeo
Várias imagens para vídeo
Referência para vídeo para vídeo
Fica mais fácil de explicar com um exemplo.
Digamos que você queira pegar um personagem do vídeo de referência um, usar o movimento de câmera do vídeo de referência dois e inseri-los no vídeo de referência três — dá para fazer isso. Você anexaria os três vídeos e digitaria algo como:
Pegue o personagem de @video1, adicione-o ao @vidoe3 e use o movimento de câmera de @vidoe2. Mude também o estilo para pixel art.
Esse é um fluxo de trabalho de referência-e-texto-para-keyframe-para-vídeo!
O modelo foi lançado com acesso imediato pela nova interface criativa da Kling, e também está disponível na Overchat AI para quem quer um acesso descomplicado aos modelos de IA mais avançados.
O que torna o Kling o1 melhor do que os outros modelos de vídeo?
1. Aceita qualquer entrada
O VIDEO O1 aceita imagens, vídeos, referências de personagens, prompts de texto ou qualquer combinação desses elementos e trata tudo como peças interligadas da sua visão criativa. Você pode combinar e misturar, modificar e editar, alterar e reaproveitar elementos da forma que quiser — o único limite é a sua imaginação.
2. Obediência aos comandos em outro patamar
O VIDEO O1 tem uma precisão excepcional em seguir prompts. Você pode:
Usar imagens ou elementos como referência, incluindo personagens, objetos e cenários.
Transformar vídeos adicionando ou removendo conteúdo, trocando ângulos, modificando personagens, fundos, estilos, cores e clima
Gerar os planos anteriores ou seguintes a partir de uma filmagem já existente
Usar o controle de quadro inicial e final para criar transições e movimentos de câmera
3. Referência tudo-em-um
Um dos maiores desafios na geração de vídeo com IA sempre foi a consistência. O VIDEO O1 enfrenta esse problema de frente com um sistema de referência que funciona como a memória de um diretor de cinema.
Envie imagens de referência ou crie elementos a partir de vários ângulos, e o modelo mantém a consistência de personagens, objetos e cenários em cada quadro — independentemente do movimento de câmera ou das mudanças de cena.
Mais impressionante ainda, o VIDEO O1 lida com vários personagens ao mesmo tempo. Em cenas de grupo complexas ou em situações de interação, o modelo fixa e preserva de forma independente as características únicas de cada personagem ou objeto.
4. Capacidade de alterar muitas coisas de uma vez
Quem cria com IA conhece bem a frustração de ter que passar por inúmeras etapas para alcançar um resultado simples.
Por exemplo, se você quisesse inserir um personagem em outra cena e trocar a roupa dele, talvez precisasse:
tirar uma imagem estática dele
aumentar a resolução
gerar uma imagem com uma pose neutra
trocar a roupa dele em um gerador de imagens
e então jogá-lo de volta em um gerador de vídeo para criar uma nova cena com ele.
Durante muito tempo, os fluxos de trabalho em plataformas como o Comfy UI ou o FAL foram a saída para isso. Eles são basicamente cadeias automatizadas de prompts que passam a saída de um modelo para o próximo com instruções. Esse método funciona, mas leva muito tempo e custa muito dinheiro ou créditos (cada geração tem um custo).
Mas o VIDEO O1 não limita você a tarefas isoladas. Você pode combinar diferentes operações em um único prompt: adicionar um personagem enquanto modifica o fundo, mudar o estilo usando elementos de referência ou misturar qualquer combinação dos recursos do modelo.
Isso abre exponencialmente mais possibilidades criativas do que os tradicionais fluxos de trabalho lineares.
5. Duração de vídeo personalizável entre 3 e 10 segundos
Toda história tem seu próprio ritmo. O VIDEO O1 permite gerar livremente vídeos entre 3 e 10 segundos, dando a você controle total sobre o ritmo da narrativa.
Como o Kling VIDEO O1 se compara à concorrência
A tabela a seguir mostra como o Kling o1 se sai em relação ao Veo 3.1, ao Runway Aleph e ao Seedance:
Recurso
Kling VIDEO O1
Google Veo 3.1
Runway Aleph
Seedance
Referência de imagem/elemento
Referência de imagem
✓
✓
✗
✓
Referência de elemento
✓
✗
✗
✗
Referência de imagem + elemento
✓
✗
✗
✗
Transformação
Adicionar conteúdo ao vídeo
✓
✓
✓
✗
Remover conteúdo do vídeo
✓
✗
✓
✗
Trocar ângulo/tamanho do plano
✓
✓
✓
✗
Modificar elemento do vídeo
✓
✗
✓
✗
Modificar partes do vídeo
✓
✗
✓
✗
Modificar estilo do vídeo
✓
✗
✓
✗
Modificar cor do objeto
✓
✗
✓
✗
Modificar o clima do vídeo
✓
✗
✓
✗
Chroma key (tela verde) em vídeo
✓
✗
✓
✗
Suporte a 2 ou mais imagens
✓
✗
✗
✗
Suporte ao uso de elementos
✓
✗
✗
✗
Referência de vídeo
Gerar o próximo plano
✓
✗
✓
✗
Gerar o plano anterior
✓
✗
✓
✗
Referenciar movimentos de câmera do vídeo
✓
✗
✗
✗
Referenciar ações do vídeo
✓
✗
✗
✗
Quadros inicial e final
Gerar vídeo a partir do quadro inicial
✓
✓
✓
✓
Gerar vídeo com quadros inicial e final
✓
✓
✓
✓
Texto para vídeo
✓
✓
✓
✓
Geração com habilidades combinadas
✓
✗
✗
✗
Segundo a avaliação interna da Kling AI, o VIDEO O1 alcançou uma taxa de vitória de desempenho de 247% em relação ao recurso Ingredients to Video do Google Veo 3.1 em tarefas de referência por imagem, e uma taxa de vitória de desempenho de 230% em relação ao Runway Aleph em tarefas de transformação.
O que dá para fazer com o VIDEO O1?
Graças ao amplo controle que oferece, o VIDEO O1 é excelente para aplicações profissionais em muitos setores, incluindo, mas não se limitando a, os seguintes:
Cinema com IA: fixe personagens e objetos usando a Element Library para gerar várias cenas com consistência perfeita.
Publicidade: substitua gravações tradicionais caras e demoradas enviando imagens do produto, do modelo e do fundo.
Moda: crie infinitas passarelas virtuais enviando fotos de modelos e imagens de roupas.
Pós-produção: em vez de tracking e máscaras complicados, use instruções simples em linguagem natural.
Como a Kling chegou a esses resultados?
Os recursos do VIDEO O1 se apoiam em três inovações técnicas:
Transformer multimodal. O Kling o1 usa um Transformer multimodal junto com ferramentas de Contexto Longo Multimodal. Graças a esses componentes, ele consegue gerar, editar e entender vídeos dentro do mesmo sistema.
Multimodal Visual Language (MVL). O MVL é um novo formato interativo que combina texto com sinais visuais e de áudio dentro da arquitetura do Transformer. Isso cria uma compreensão geral mais forte e permite que você execute diferentes tarefas por meio de uma única entrada unificada.
Raciocínio integrado. Com o MVL, o modelo consegue se referir a detalhes multimodais específicos e dar suporte a edições interativas avançadas. Combinado com o raciocínio Chain-of-Thought, ele consegue mostrar uma lógica de senso comum clara e fazer deduções precisas sobre os acontecimentos, tornando suas gerações naturais e realistas.
Conclusão
O Kling VIDEO o1 é provavelmente o modelo de vídeo com IA mais avançado já lançado. Ele é fundamentalmente diferente de tudo o que veio antes, incluindo o Sora 2 e o Veo 3.1, na forma como você o controla e interage com ele.
Isso o torna mais difícil de aprender, porque você precisa entender seus diferentes recursos e como eles entram no processo de geração de vídeo. Mas, se você aprender a usá-lo, vai conseguir criar resultados profissionais de forma muito mais rápida, fácil e barata do que antes.
A era de fazer malabarismo com várias ferramentas de vídeo com IA e montar fluxos de trabalho complexos e caros acabou. Bem-vindo à geração de vídeo multimodal unificada.