A equipe do Kling AI, da Kuaishou, projetou seu modelo de quarta geração, o Kling 4.0, para quem quer dirigir uma cena em vez de apostar em um único prompt. Você fixa keyframes em uma linha do tempo de até 30 segundos, atribui uma função a cada arquivo de referência, e o modelo preenche o movimento, o trabalho de câmera e o som entre essas âncoras.
Em breve
Este workspace vai rodar o Kling 4.0 em breve
A geração é ativada aqui assim que o Kling 4.0 estiver conectado. Você já pode trabalhar essa mesma ideia com os modelos abaixo e trazer o prompt depois.
Comece um projeto com
Kling 4.0
Modelo de vídeo orientado por keyframes da Kling AI
Perfil do modelo
Os números que definem o quanto uma única geração do Kling 4.0 pode comportar, da duração do clipe ao número de arquivos com os quais ela pode aprender.
| Item | Kling 4.0 |
|---|---|
| Criado por | Kling AI, a plataforma de vídeo da Kuaishou |
| Entradas | Textos, imagens, clipes de vídeo, sujeitos e referências de voz |
| Duração do clipe | 3 a 30 segundos por geração |
| Controle da linha do tempo | Até 10 keyframes |
| Referências | Até 15 no total: 10 imagens, 5 vídeos, 7 sujeitos |
| Qualidade de imagem | Até 4K; HDR de 10 bits em 1080p e 4K |
| Proporções | 16:9, 9:16, 1:1 e 21:9 ultrawide |
| Som | Estéreo de dois canais com sincronia labial mais precisa |
| Texto e fala | Texto na tela e diálogos em nove idiomas |
| Comprimento do prompt | Até 8,000 tokens |
| Edição | Até 5 clipes existentes, 30 segundos no total |
| Extensão | Uma sequência pode ser estendida para cerca de dois minutos |
O Kling 3.0 já produzia tomadas cinematográficas com som nativo. O Kling 4.0 mantém essa base e acrescenta principalmente mais espaço na linha do tempo e um controle mais fino sobre ela.
Comprimento
Kling 3.0:3–15 segundosKling 4.0:3–30 segundos
Uma cena completa, com preparação, ação e desfecho, cabe em um único take, em vez de dois clipes emendados.
Controle de frames
Kling 3.0:Primeiro e último frameKling 4.0:Até 10 keyframes
O meio da tomada também pode ser fixado, como uma virada de cabeça ou o momento em que um produto é revelado.
Qualidade de imagem
Kling 3.0:Até 4KKling 4.0:Até 4K, HDR de 10 bits em 1080p e 4K
Céus e tons de pele podem ser graduados sem banding, e os realces mantêm seus detalhes.
Proporções
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:Adiciona ultrawide 21:9
Composições em widescreen com estilo cinema saem direto do modelo, sem nenhum recorte depois.
Som
Kling 3.0:Áudio nativoKling 4.0:Áudio estéreo, sincronia labial mais precisa
As falas encaixam no movimento da boca, e a ambiência tem espaço à esquerda e à direita.
Um keyframe é uma imagem estática fixada a um momento do clipe. O Kling 4.0 anima o caminho de um keyframe até o próximo, então os frames que você escolhe se tornam o esqueleto da cena. Um plano típico de quatro pontos é assim:
Frame inicial
Defina o cenário, a luz e o sujeito principal. É a primeira imagem que o espectador vê.
Primeira alteração
Fixe o momento em que a ação começa: um personagem se levanta, uma tampa se abre, um carro arranca.
Ponto de virada
Corrija o frame em que o plano muda de direção, como em um reveal ou em um novo ângulo de câmera.
Quadro final
Trave o final para que o clipe termine em uma composição da qual você possa cortar ou estender.
Dois keyframes bastam para um movimento simples. Adicione mais apenas onde um momento precisa ficar exatamente como planejado: cada keyframe extra limita o que o modelo pode inventar entre eles.
O Omni Reference permite que uma única tarefa inclua vários tipos de material de origem ao mesmo tempo. Cada tipo tem seu próprio limite dentro do total compartilhado de 15.
| Entrada | Até | Ideal para |
|---|---|---|
| Imagens | 10 | Turnarounds de personagens, ângulos de produto, cenários, storyboards e style frames |
| Vídeos | 5, 30 s combinados | Movimento, coreografia, trajetórias de câmera e ritmo a seguir |
| Assuntos | 7 | Pessoas, mascotes ou produtos recorrentes que devem manter a mesma aparência do início ao fim |
| Voz | Compatível | O tom e o timbre de um personagem que fala |
Especifique o papel de cada arquivo no prompt, por exemplo: "a imagem 2 é a jaqueta, o vídeo 1 é o movimento de câmera". Referências sem um papel declarado competem entre si.
Flash é a edição mais leve da mesma geração de modelos. Ele abre mão de duração, resolução e keyframes em troca de resultados mais rápidos.
Para peças finalizadas que você planeja publicar
Para rascunhos, testes e alto volume
Uma rotina prática: teste várias ideias rapidamente no Flash, depois recrie no modelo completo aquela que você mantiver e adicione keyframes onde for importante.
Cada um consegue entregar uma tomada completa de 30 segundos de uma só vez. O que os diferencia é a forma como você dá as instruções.
| Comparação | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| Geração única mais longa | 30 segundos | 30 segundos |
| Principal forma de direcionar | Keyframes fixados em uma linha do tempo | Uma pilha de referências mais um prompt escrito |
| Capacidade de referência | 15 entradas: 10 imagens, 5 vídeos, 7 sujeitos | 50 entradas: 30 imagens, 10 vídeos, 10 arquivos de áudio |
| Áudio como entrada | Referências de tom de voz | Até 10 arquivos de áudio |
| Melhor em | Timing exato dos momentos-chave, entrega em HDR | Briefings multimodais extensos, planejamento de cenas com posicionamento de câmera |
Escolha o Kling 4.0 quando momentos específicos precisam aparecer em horários específicos. Escolha o Seedance 3.0 quando o briefing for um grande conjunto de imagens, clipes e som com o qual o modelo deve aprender.
Prompts longos funcionam quando cada parte tem um lugar fixo. Escreva-os nesta ordem e limite cada parte a uma frase ou duas.
1. Assunto
Um ciclista com uma capa de chuva amarela
2. Ação
freia, desce da bicicleta e olha para cima
3. Configurações
em uma rua de paralelepípedos molhados ao anoitecer
4. Câmera
um travelling baixo que sobe e se transforma em um movimento de gru
5. Claro
letreiros de neon refletidos nas poças
6. Timing
0–10 s andando, 10–20 s parando, 20–30 s olhando para cima
7. Som
chuva, chiado dos pneus, o sino distante de um bonde
8. Referências
O sujeito 1 é o ciclista, a imagem 3 é a rua
0–8 s: vapor sobe de uma xícara de cerâmica sobre um balcão de madeira iluminado pelo sol, push-in lento. 8–16 s: a mão de um barista desliza a xícara para frente e o foco vai para a arte no latte. 16–24 s: um lugar junto à janela, uma mulher dá o primeiro gole e sorri. 24–30 s: plano aberto do café na hora dourada. Som: zumbido do moedor, violão acústico suave, uma xícara sendo apoiada no pires.
Um drone desliza sobre arrozais em terraços ao nascer do sol, névoa repousando nos vales, um agricultor caminhando ao longo de uma crista. A câmera desce lentamente e termina na altura dos olhos, ao lado do agricultor. Apenas canto de pássaros e vento, sem música.
Uma cozinha à noite sob luz prática quente. Sujeito 1, um homem mais velho, pergunta: "Você terminou?" Sujeito 2, uma adolescente, ergue um caderno de desenho e responde: "Quase." Plano médio duplo, leve movimento de câmera na mão, som ambiente estéreo discreto.
A imagem 1 é o tênis, a imagem 2 é o fundo de estúdio. O tênis gira uma vez sobre um prato giratório lustroso enquanto uma luz suave varre a malha; a câmera termina em um ângulo hero de três quartos. Um pulso eletrônico suave ao fundo.
A linha do tempo mais longa e o controle de keyframes fazem mais diferença em trabalhos nos quais timing e consistência integram o briefing.
Respostas curtas sobre duração, qualidade de imagem, controle, som e como o Kling 4.0 se compara a outros modelos de vídeo.
É o quarto grande modelo de vídeo lançado pelo Kling AI, a equipe de vídeo generativo da Kuaishou. Basta fornecer texto, imagens estáticas, clipes curtos e referências de sujeito, e ele retorna um clipe de 3 a 30 segundos com som, seguindo até 10 keyframes que você posiciona na linha do tempo.
Trinta segundos por geração, com mínimo de três segundos. Para durações maiores, estenda o clipe pronto; as extensões podem levar uma cena a cerca de dois minutos.
Até 4K. Tanto as saídas em 1080p quanto as em 4K têm HDR de 10 bits, então pores do sol e tons de pele resistem à gradação sem degraus visíveis. A edição Flash, mais leve, fica limitada a 720p em SDR de 8 bits.
Você posiciona até 10 imagens estáticas em momentos escolhidos do clipe. O modelo as trata como pontos fixos e gera o movimento entre elas.
Use dois keyframes para um movimento simples de início a fim, e acrescente mais apenas quando um momento precisar ficar exatamente como planejado.
Até 15 no total:
As referências de voz também podem definir o tom de um personagem falante.
O Flash é otimizado para velocidade, não para acabamento. Ele gera até 20 segundos em até 720p em 8-bit SDR e não aceita frame inicial/final nem entrada com múltiplos keyframes. Troque para o modelo completo quando precisar dos 30 segundos, de keyframes, do orçamento completo de referências, de 4K ou de HDR.
Sim. Ele gera áudio estéreo de dois canais junto com a imagem, incluindo diálogos, ambiência e efeitos, com sincronia labial mais precisa do que os modelos Kling anteriores.
Os personagens podem falar em nove idiomas, com espaço para diferentes sotaques e dialetos. O modelo também consegue renderizar textos na tela em nove idiomas, além de emojis.
Sim. O modo de edição aceita até cinco clipes existentes, 30 segundos no total, e consegue alterar o sujeito, o fundo, a expressão, o ângulo da câmera ou uma fala a partir de uma instrução de texto, imagem ou sujeito.
Sim. Além de 16:9, 9:16 e 1:1, o Kling 4.0 adiciona um enquadramento ultrawide 21:9 para composições de estilo cinematográfico.
Os prompts podem chegar a 8.000 tokens, o que é suficiente para um roteiro cronometrado com notas de câmera, diálogos e marcações de som. A ordem importa mais do que o tamanho: liste sujeito, ação, cenário, câmera, luz, tempo e som sempre na mesma sequência.
Sim, se você precisa de clipes com mais de 15 segundos, controle sobre momentos no meio de uma tomada, saída em HDR ou enquadramento 21:9. Para clipes curtos de uma única ação, o Kling 3.0 continua sendo uma escolha sólida.
Escolha o Kling 4.0 quando o timing exato importa, porque os keyframes dele definem o que acontece e quando. Escolha o Seedance 3.0 quando você quiser direcionar o resultado com um conjunto amplo de referências; ele aceita até 50 imagens, vídeos e arquivos de áudio em uma única tarefa.
Registre a pessoa como referência de sujeito, mostre-a no keyframe inicial e use o mesmo rótulo para se referir a ela em todo o prompt. Uma pessoa, uma referência: duas fotos diferentes do mesmo personagem puxam o resultado para dois lados.