Kuaishous Kling AI-team designade sin fjärde generationens modell, Kling 4.0, för människor som vill regissera en tagning i stället för att chansa på en enda prompt. Du fäster keyframes på en tidslinje på upp till 30 sekunder, ger varje referensfil en uppgift, och modellen fyller i rörelsen, kameraarbetet och ljudet mellan dessa fästpunkter.
Kommer snart
Den här arbetsytan kommer snart att köra Kling 4.0
Generering slås på här så snart Kling 4.0 är ansluten. Du kan redan forma samma idé med modellerna nedan och flytta över prompten senare.
Starta ett projekt med
Kling 4.0
Keyframebaserad videomodell från Kling AI
Modellprofil
Siffrorna som avgör hur mycket en enskild Kling 4.0-generering kan rymma, från klipplängd till antalet filer den kan lära sig av.
| Objekt | Kling 4.0 |
|---|---|
| Skapad av | Kling AI, videoplattformen från Kuaishou |
| Indata | Text, bilder, videoklipp, motiv och röstreferenser |
| Klipplängd | 3 till 30 sekunder per generering |
| Tidslinjekontroll | Upp till 10 keyframes |
| Referenser | Upp till 15 totalt: 10 bilder, 5 videor, 7 motiv |
| Bildkvalitet | Upp till 4K; 10-bitars HDR vid 1080p och 4K |
| Bildförhållanden | 16:9, 9:16, 1:1 och 21:9 ultrawide |
| Ljud | Tvåkanalig stereo med tightare läppsynk |
| Text och tal | Skärmtext och dialog på nio språk |
| Promptlängd | Upp till 8,000 tokens |
| Redigering | Upp till 5 befintliga klipp, totalt 30 sekunder |
| Tillägg | En sekvens kan förlängas till cirka två minuter |
Kling 3.0 producerade redan filmiska tagningar med inbyggt ljud. Kling 4.0 behåller den grunden och lägger främst till utrymme på tidslinjen samt finare kontroll över den.
Längd
Kling 3.0:3–15 sekunderKling 4.0:3–30 sekunder
En hel scen med uppbyggnad, handling och poäng ryms i en enda tagning i stället för två ihopsatta klipp.
Bildrutekontroll
Kling 3.0:Första och sista bildrutanKling 4.0:Upp till 10 nyckelbildrutor
Mitten av klippet kan också låsas, till exempel en huvudvridning eller ögonblicket då en produkt avslöjas.
Bildkvalitet
Kling 3.0:Upp till 4KKling 4.0:Upp till 4K, 10-bitars HDR i 1080p och 4K
Himlar och hudtoner graderas utan bandning, och högdagrar behåller detaljerna.
Bildförhållanden
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:Lägger till 21:9 ultrawide
Filmiska bredbildskompositioner kommer direkt ur modellen, utan beskärning i efterhand.
Ljud
Kling 3.0:Ursprungligt ljudKling 4.0:Stereoljud, mer exakt läppsynk
Linjerna landar på munrörelsen, och ambience har utrymme till vänster och höger.
En nyckelbild är en stillbild fäst vid ett ögonblick i klippet. Kling 4.0 animerar banan från en nyckelbild till nästa, så bildrutorna du väljer blir tagningens skelett. En typisk plan med fyra punkter ser ut så här:
Startbild
Sätt platsen, ljuset och huvudmotivet. Det här är den första bilden en tittare ser.
Första ändringen
Fäst ögonblicket när actionen startar: en karaktär reser sig, ett lock lyfts, en bil kör iväg.
Vändpunkt
Fixa bildrutan där tagningen byter riktning, till exempel vid ett avslöjande eller en ny kameravinkel.
Sista bildrutan
Lås slutet så att klippet landar på en komposition du kan klippa ifrån eller förlänga.
Två keyframes räcker för en enkel rörelse. Lägg bara till fler där ett ögonblick måste se ut exakt som planerat: varje extra keyframe snävar in vad modellen kan hitta på mellan dem.
Omni Reference låter en uppgift innehålla flera typer av källmaterial samtidigt. Varje typ har sitt eget maxtak inom den gemensamma totalen på 15.
| Indata | Upp till | Passar bäst för |
|---|---|---|
| Bilder | 10 | Karaktärsvyer, produktvinklar, miljöer, storyboards och stilbilder |
| Videor | 5, 30 s kombinerat | Rörelse, koreografi, kameravägar och tempo att följa |
| Ämnen | 7 | Återkommande personer, maskotar eller produkter som måste se likadana ut genomgående |
| Röst | Stöds | Tonläge och klangfärg hos en talande karaktär |
Ange rollen för varje fil i prompten, till exempel ”bild 2 är jackan, video 1 är kamerarörelsen”. Referenser utan angiven roll konkurrerar med varandra.
Flash är den lättare versionen av samma modellgeneration. Den avstår från längd, upplösning och keyframes i utbyte mot snabbare resultat.
För färdiga verk du planerar att publicera
För utkast, tester och hög volym
En praktisk rutin: testa flera idéer snabbt i Flash, bygg sedan om den du behåller i den fullständiga modellen och lägg till keyframes där det gör skillnad.
Var och en kan leverera en komplett tagning på 30 sekunder i ett svep. Det som skiljer dem åt är hur du säger till dem vad de ska göra.
| Jämförelse | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| Längsta enskilda genereringen | 30 sekunder | 30 sekunder |
| Huvudsättet att styra | Nyckelbildrutor fästa på en tidslinje | En referensstack plus en skriven prompt |
| Referenskapacitet | 15 indata: 10 bilder, 5 videor, 7 subjekt | 50 indata: 30 bilder, 10 videor, 10 ljudfiler |
| Ljud som indata | Referenser för röstton | Upp till 10 ljudfiler |
| Bäst på | Exakt timing för nyckelögonblick, HDR-leverans | Stora multimodala briefs, scenplanering med kamerablockering |
Välj Kling 4.0 när specifika ögonblick måste inträffa vid bestämda tidpunkter. Välj Seedance 3.0 när briefen är en stor samling bilder, klipp och ljud som modellen ska lära sig av.
Långa prompter fungerar när varje del har en bestämd plats. Skriv dem i den här ordningen och håll varje del till en fras eller två.
1. Ämne
En cyklist i en gul regnjacka
2. Åtgärd
bromsar, kliver av cykeln och tittar upp
3. Inställning
på en våt kullerstensgata i skymningen
4. Kamera
en låg åkning som reser sig till en kranrörelse
5. Ljus
Neonskyltar som speglas i vattenpölarna
6. Timing
0–10 s rider, 10–20 s stannar, 20–30 s tittar upp
7. Ljud
regn, däcksus, en avlägsen spårvagnsklocka
8. Referenser
Motiv 1 är cyklisten, bild 3 är gatan
0–8 s: ånga stiger från en keramisk kopp på en soldränkt trädisk, långsam inåkning. 8–16 s: en baristas hand skjuter koppen framåt och fokus dras till latte arten. 16–24 s: en fönsterplats, en kvinna tar första klunken och ler. 24–30 s: vid bild av kaféet i gyllene timmen. Ljud: kvarnens surr, lågmäld akustisk gitarr, en kopp som ställs ner på sitt fat.
En drönare glider över terrasserade risfält i soluppgången, dimman ligger i dalarna och en bonde går längs en ås. Kameran sänker sig långsamt och slutar i ögonhöjd bredvid bonden. Bara fågelsång och vind, ingen musik.
Ett kök på natten i varmt praktiskt ljus. Person 1, en äldre man, frågar: "Är du klar med den?" Person 2, en tonårstjej, håller upp ett skissblock och svarar: "Nästan." Medium tvåskott, lätt handhållen rörelse, tyst rumsljud i stereo.
Bild 1 är sneakern, bild 2 är studiobakgrunden. Sneakern roterar ett varv på en glänsande skivtallrik medan ett mjukt ljus sveper över meshen; kameran avslutar i en hero-vinkel på trekvart. En mjuk elektronisk puls i botten.
Den längre tidslinjen och keyframe-kontrollen kommer bäst till sin rätt i arbeten där timing och konsistens är en del av briefen.
Korta svar om längd, bildkvalitet, kontroll, ljud och hur Kling 4.0 står sig jämfört med andra videomodeller.
Det är den fjärde stora videomodellen som Kling AI har släppt – det generativa videoteamet hos Kuaishou. Ge den text, stillbilder, korta klipp och motivreferenser, så returnerar den ett klipp på 3 till 30 sekunder med ljud och följer upp till 10 keyframes som du placerar på tidslinjen.
Trettio sekunder per generering, med tre sekunder som minsta längd. För längre klipp förlänger du det färdiga klippet; förlängningar kan sträcka ut en scen till ungefär två minuter.
Upp till 4K. Både 1080p- och 4K-utdata har 10-bitars HDR, så att solnedgångar och hudtoner klarar färgkorrigering utan synliga steg. Den lättare Flash-utgåvan stannar vid 720p i 8-bitars SDR.
Du placerar upp till 10 stillbilder vid valda tidpunkter i klippet. Modellen behandlar dem som fasta punkter och genererar rörelsen mellan dem.
Använd två keyframes för en enkel rörelse från start till slut, och lägg bara till fler där ett ögonblick måste se ut precis som planerat.
Upp till 15 totalt:
Röstreferenser kan också sätta tonen för en talande karaktär.
Flash är optimerad för hastighet snarare än finish. Den genererar upp till 20 sekunder i upp till 720p i 8-bitars SDR och tar inte emot första/sista bildruta eller indata med flera keyframes. Byt till den fullständiga modellen när du behöver 30-sekunderslängden, keyframes, hela referensbudgeten, 4K eller HDR.
Ja. Den producerar tvåkanaligt stereoljud tillsammans med bilden, inklusive dialog, atmosfär och ljudeffekter, med mer exakt läppsynk än tidigare Kling-modeller.
Karaktärer kan tala nio språk, med utrymme för olika accenter och dialekter. Modellen kan även rendera text på skärmen på nio språk, samt emojis.
Ja. Redigeringsläget tar upp till fem befintliga klipp, totalt 30 sekunder, och kan ändra motiv, bakgrund, ansiktsuttryck, kameravinkel eller en replik utifrån en text-, bild- eller motivinstruktion.
Ja. Förutom 16:9, 9:16 och 1:1 lägger Kling 4.0 till ett ultrabredt 21:9-format för filmiska kompositioner.
En prompt kan rymma upp till 8,000 tokens, vilket räcker för ett tidsatt manus med kameranoter, dialog och ljudmarkeringar. Ordningen spelar större roll än längden: ange subjekt, handling, miljö, kamera, ljus, tajming och ljud i samma följd varje gång.
Ja, om du behöver klipp längre än 15 sekunder, kontroll över moment mitt i en tagning, HDR-utdata eller en 21:9-bildruta. För korta klipp med en enda handling är Kling 3.0 fortfarande ett stabilt val.
Välj Kling 4.0 när exakt timing spelar roll, eftersom dess keyframes fastställer vad som händer när. Välj Seedance 3.0 när du vill styra resultatet med en stor uppsättning referenser; den tar emot upp till 50 bilder, videor och ljudfiler i en och samma uppgift.
Registrera personen som subjektreferens, visa personen i den inledande keyframen och hänvisa till personen med samma etikett genom hela prompten. En person, en referens: två olika foton av samma karaktär drar resultatet åt två håll.