Zespół Kling AI z Kuaishou zaprojektował swój model czwartej generacji, Kling 4.0, dla osób, które chcą reżyserować ujęcie, a nie stawiać wszystkiego na jeden prompt. Przypinasz klatki kluczowe na osi czasu o długości do 30 sekund, przydzielasz każdemu plikowi referencyjnemu zadanie, a model uzupełnia ruch, pracę kamery i dźwięk między tymi punktami.
Wkrótce
Ta przestrzeń robocza wkrótce będzie obsługiwać Kling 4.0
Generowanie włączy się tutaj, gdy tylko Kling 4.0 zostanie podłączony. Ten sam pomysł możesz już opracować, korzystając z modeli poniżej, a prompt przenieść później.
Rozpocznij projekt z
Kling 4.0
Model wideo oparty na klatkach kluczowych od Kling AI
Profil modelu
Liczby, które decydują o tym, ile pomieści pojedyncze generowanie w Kling 4.0 — od długości klipu po liczbę plików, na których może się uczyć.
| Element | Kling 4.0 |
|---|---|
| Wykonane przez | Kling AI, platforma wideo Kuaishou |
| Dane wejściowe | Tekst, obrazy, klipy wideo, obiekty i referencje głosowe |
| Długość klipu | od 3 do 30 sekund na generowanie |
| Sterowanie osią czasu | Do 10 klatek kluczowych |
| Referencje | Łącznie do 15: 10 obrazów, 5 filmów, 7 obiektów |
| Jakość obrazu | Do 4K; 10-bit HDR przy 1080p i 4K |
| Proporcje obrazu | 16:9, 9:16, 1:1 i ultrapanoramiczny 21:9 |
| Dźwięk | Dwukanałowe stereo z precyzyjniejszą synchronizacją ust |
| Tekst i mowa | Tekst na ekranie i dialogi w dziewięciu językach |
| Długość promptu | Do 8,000 tokenów |
| Edycja | Maksymalnie 5 istniejących klipów, łącznie 30 sekund |
| Rozszerzenie | Sekwencję można wydłużyć do około dwóch minut. |
Kling 3.0 już generował kinowe ujęcia z natywnym dźwiękiem. Kling 4.0 zachowuje tę podstawę, a przede wszystkim dodaje więcej miejsca na osi czasu i precyzyjniejszą kontrolę nad nią.
Długość
Kling 3.0:3–15 sekundKling 4.0:3–30 sekund
Pełna scena z zawiązaniem, akcją i pointą mieści się w jednym ujęciu zamiast dwóch sklejonych klipów.
Sterowanie klatkami
Kling 3.0:Pierwsza i ostatnia klatkaKling 4.0:Do 10 klatek kluczowych
Środek ujęcia również można przypiąć, na przykład obrót głowy lub moment odsłonięcia produktu.
Jakość obrazu
Kling 3.0:Do 4KKling 4.0:Do 4K, 10-bit HDR w 1080p i 4K
Gradacja nieba i odcieni skóry przebiega bez bandingu, a światła zachowują detal.
Proporcje obrazu
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:Dodaje format ultrawide 21:9
Kinowe kompozycje panoramiczne wychodzą wprost z modelu, bez późniejszego kadrowania.
Dźwięk
Kling 3.0:Natywne audioKling 4.0:Dźwięk stereo, precyzyjniejsza synchronizacja ust
Kwestie idealnie trafiają w ruch ust, a dźwięk otoczenia ma przestrzeń po lewej i prawej.
Klatka kluczowa to nieruchomy obraz przypięty do konkretnego momentu klipu. Kling 4.0 animuje ścieżkę od jednej klatki kluczowej do następnej, dzięki czemu wybrane klatki stają się szkieletem ujęcia. Typowy plan czteropunktowy wygląda tak:
Klatka początkowa
Ustaw scenerię, oświetlenie i główny obiekt. To pierwszy obraz, który widzi widz.
Pierwsza zmiana
Uchwyć moment, w którym zaczyna się akcja: postać wstaje, pokrywka się unosi, samochód odjeżdża.
Punkt zwrotny
Ustal klatkę w miejscu, w którym ujęcie zmienia kierunek — np. przy odsłonięciu kadru lub nowym kącie kamery.
Klatka końcowa
Zablokuj zakończenie, aby klip kończył się na kompozycji, od której możesz kontynuować montaż albo ją rozszerzyć.
Dwie klatki kluczowe wystarczą do prostego ruchu. Dodawaj kolejne tylko tam, gdzie dany moment musi wyglądać dokładnie tak, jak zaplanowano: każda dodatkowa klatka kluczowa ogranicza to, co model może wymyślić między nimi.
Omni Reference pozwala, aby jedno zadanie zawierało jednocześnie kilka rodzajów materiałów źródłowych. Każdy rodzaj ma własny limit w ramach wspólnej puli wynoszącej 15.
| Wejście | Do | Najlepsze zastosowania |
|---|---|---|
| Obrazy | 10 | Obroty postaci, ujęcia produktowe z różnych kątów, lokacje, storyboardy i style frames |
| Filmy | 5, 30 s łącznie | Ruch, choreografia, ścieżki kamery i tempo, których należy przestrzegać |
| Podmioty | 7 | Powracające osoby, maskotki lub produkty, które muszą wyglądać tak samo przez cały czas |
| Głos | Obsługiwane | Ton i barwa głosu mówiącej postaci |
Określ rolę każdego pliku w prompcie, na przykład „obraz 2 to kurtka, wideo 1 to ruch kamery”. Odniesienia bez podanej roli konkurują ze sobą.
Flash to lżejsza wersja tej samej generacji modelu. Rezygnuje z długości, rozdzielczości i klatek kluczowych na rzecz szybszych efektów.
Dla gotowych materiałów, które planujesz opublikować
Do wersji roboczych, testów i dużego wolumenu
Praktyczny sposób pracy: wypróbuj szybko kilka pomysłów w Flash, a następnie odtwórz ten, który zachowujesz, w pełnym modelu i dodaj klatki kluczowe tam, gdzie to ważne.
Każdy z nich potrafi zwrócić pełne 30-sekundowe ujęcie za jednym razem. Ich drogi rozchodzą się w tym, jak mówisz im, co mają robić.
| Porównanie | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| Najdłuższe pojedyncze generowanie | 30 sekund | 30 sekund |
| Główny sposób sterowania | Klatki kluczowe przypięte na osi czasu | Stos referencji plus prompt tekstowy |
| Liczba referencji | 15 danych wejściowych: 10 obrazów, 5 filmów, 7 obiektów | 50 danych wejściowych: 30 obrazów, 10 filmów, 10 plików audio |
| Audio jako dane wejściowe | Referencje tonu głosu | Do 10 plików audio |
| Najmocniejszy w | Precyzyjne wyczucie czasu kluczowych momentów, dostarczanie w HDR | Rozbudowane briefy multimodalne, planowanie scen z ustawieniem kamery |
Wybierz Kling 4.0, gdy konkretne momenty muszą pojawić się w dokładnie określonym czasie. Wybierz Seedance 3.0, gdy brief to duży zbiór obrazów, klipów i dźwięku, z którego model ma się uczyć.
Długie prompty działają wtedy, gdy każda część ma swoje stałe miejsce. Zapisuj je w tej kolejności, a każdą część ogranicz do jednej–dwóch fraz.
1. Temat
Rowerek w żółtej kurtce przeciwdeszczowej
2. Akcja
hamuje, zsiada z roweru i podnosi wzrok
3. Ustawienia
na mokrej brukowanej ulicy o zmierzchu
4. Kamera
niski przejazd kamery, który wznosi się i przechodzi w ruch kranu
5. Jasny
Neonowe szyldy odbijające się w kałużach
6. Timing
0–10 s jazda, 10–20 s zatrzymywanie się, 20–30 s patrzenie w górę
7. Dźwięk
deszcz, syk opon, dzwonek tramwaju w oddali
8. Referencje
Obiekt 1 to rowerzysta, obraz 3 to ulica
0–8 s: para unosi się z ceramicznej filiżanki na oświetlonym słońcem drewnianym blacie, powolny najazd kamery. 8–16 s: dłoń baristy przesuwa filiżankę do przodu, a ostrość przenosi się na latte art. 16–24 s: miejsce przy oknie, kobieta bierze pierwszy łyk i się uśmiecha. 24–30 s: szeroki plan kawiarni w złotej godzinie. Dźwięk: szum młynka, cicha gitara akustyczna, filiżanka odstawiana na spodek.
Dron szybuje nad tarasami ryżowymi o wschodzie słońca, mgła zalega w dolinach, jeden rolnik idzie wzdłuż grzbietu. Kamera powoli opada i kończy na wysokości oczu obok rolnika. Tylko śpiew ptaków i wiatr, bez muzyki.
Kuchnia nocą, w ciepłym świetle praktycznym. Postać 1, starszy mężczyzna, pyta: „Skończyłaś to?". Postać 2, nastoletnia dziewczyna, unosi szkicownik i odpowiada: „Prawie". Plan średni z dwiema postaciami, delikatny ruch z ręki, cichy stereofoniczny szum pomieszczenia.
Obraz 1 to sneaker, obraz 2 to tło studyjne. Sneaker wykonuje jeden obrót na błyszczącej obrotówce, a miękkie światło przesuwa się po siateczce; kamera kończy na ujęciu hero w trzech czwartych. Delikatny elektroniczny puls w tle.
Dłuższa os czasu i kontrola klatek kluczowych dają najwięcej w projektach, w których timing i spójność są częścią założeń.
Krótkie odpowiedzi na temat długości, jakości obrazu, kontroli i dźwięku oraz tego, jak Kling 4.0 wypada na tle innych modeli wideo.
To czwarty duży model wideo wydany przez Kling AI, zespół generatywnego wideo w Kuaishou. Podaj mu tekst, obrazy statyczne, krótkie klipy i referencje obiektów, a zwróci 3–30-sekundowy klip z dźwiękiem, podążając za maksymalnie 10 klatkami kluczowymi, które umieścisz na osi czasu.
Trzydzieści sekund na jedno generowanie, a minimum to trzy sekundy. Jeśli potrzebujesz dłuższego materiału, przedłuż gotowy klip; przedłużenia pozwalają wydłużyć jedną scenę do około dwóch minut.
Do 4K. Zarówno materiały wyjściowe w 1080p, jak i w 4K mają 10-bit HDR, dzięki czemu zachody słońca i odcienie skóry przetrwają grading bez widocznych przejść. Lżejsza edycja Flash ogranicza się do 720p w 8-bit SDR.
Umieszczasz do 10 statycznych obrazów w wybranych momentach klipu. Model traktuje je jako punkty stałe i generuje ruch pomiędzy nimi.
Do prostego przejścia od początku do końca użyj dwóch klatek kluczowych, a kolejne dodawaj tylko tam, gdzie dany moment musi wyglądać dokładnie tak, jak zaplanowano.
Łącznie do 15:
Referencje głosowe mogą również nadawać ton postaci mówiącej.
Flash jest zoptymalizowany pod szybkość, a nie pod dopracowanie. Generuje filmy do 20 sekund w jakości do 720p, w 8-bit SDR, i nie przyjmuje na wejściu pierwszej/ostatniej klatki ani wielu klatek kluczowych. Przełącz się na pełny model, gdy potrzebujesz 30 sekund, klatek kluczowych, pełnego budżetu na materiały referencyjne, 4K lub HDR.
Tak. Generuje dwukanałowe audio stereo razem z obrazem — dialogi, dźwięki otoczenia i efekty — z dokładniejszą synchronizacją ruchu warg niż wcześniejsze modele Kling.
Postacie mogą mówić w dziewięciu językach, z uwzględnieniem różnych akcentów i dialektów. Model może też renderować tekst na ekranie w dziewięciu językach, a także emoji.
Tak. Jego tryb edycji przyjmuje do pięciu istniejących klipów, łącznie 30 sekund, i pozwala zmienić podmiot, tło, wyraz twarzy, kąt kamery lub kwestię dialogową na podstawie tekstu, obrazu lub instrukcji dotyczącej podmiotu.
Tak. Oprócz 16:9, 9:16 i 1:1, Kling 4.0 dodaje ultrapanoramiczny kadr 21:9 do kompozycji w stylu kinowym.
Prompty mogą mieć nawet 8,000 tokenów — to wystarczy na scenariusz z rozpisaniem czasu, uwagami do kamery, dialogami i wskazówkami dźwiękowymi. Kolejność liczy się bardziej niż długość: za każdym razem podawaj temat, akcję, scenerię, kamerę, światło, czas i dźwięk w tej samej kolejności.
Tak — jeśli potrzebujesz klipów dłuższych niż 15 sekund, kontroli nad momentami w środku ujęcia, eksportu HDR lub kadru 21:9. Do krótkich klipów z pojedynczą akcją Kling 3.0 nadal pozostaje solidnym wyborem.
Wybierz Kling 4.0, gdy liczy się dokładne wyczucie czasu — jego klatki kluczowe ustalają, co dzieje się i kiedy. Wybierz Seedance 3.0, gdy chcesz sterować rezultatem za pomocą dużego zestawu materiałów referencyjnych; w jednym zadaniu przyjmuje do 50 obrazów, filmów i plików audio.
Zarejestruj osobę jako referencję podmiotu, pokaż ją w początkowej klatce kluczowej i odwołuj się do niej tą samą etykietą w całym prompcie. Jedna osoba, jedna referencja: dwa różne zdjęcia tej samej postaci ciągną wynik w dwóch kierunkach.