Tim Kling AI dari Kuaishou merancang model generasi keempatnya, Kling 4.0, bagi mereka yang ingin menyutradarai satu shot alih-alih bertaruh pada satu prompt. Anda menandai keyframe pada timeline hingga 30 detik, memberi tugas pada setiap file referensi, dan model mengisi gerakan, tata kamera, serta suara di antara titik acuan tersebut.
Segera hadir
Workspace ini akan segera menjalankan Kling 4.0
Generasi akan aktif di sini begitu Kling 4.0 terhubung. Anda sudah bisa mengembangkan ide yang sama dengan model di bawah ini dan memindahkan prompt-nya nanti.
Mulai proyek dengan
Kling 4.0
Model video berbasis keyframe dari Kling AI
Profil model
Angka-angka yang menentukan seberapa banyak yang bisa ditampung oleh satu generasi Kling 4.0, mulai dari durasi klip hingga jumlah file yang bisa dipelajarinya.
| Item | Kling 4.0 |
|---|---|
| Dibuat oleh | Kling AI, platform video dari Kuaishou |
| Input | Teks, gambar, klip video, subjek, dan referensi suara |
| Durasi klip | 3 hingga 30 detik per generasi |
| Kontrol Timeline | Hingga 10 keyframe |
| Referensi | Maksimal 15 total: 10 gambar, 5 video, 7 subjek |
| Kualitas gambar | Hingga 4K; HDR 10-bit pada 1080p dan 4K |
| Rasio aspek | 16:9, 9:16, 1:1, dan 21:9 ultrawide |
| Suara | Stereo dua kanal dengan lip sync yang lebih presisi |
| Teks dan ucapan | Teks di layar dan dialog dalam sembilan bahasa |
| Panjang prompt | Hingga 8,000 token |
| Mengedit | Hingga 5 klip yang ada, total 30 detik |
| Ekstensi | Sekuens dapat diperpanjang hingga sekitar dua menit. |
Kling 3.0 sudah menghasilkan shot sinematik dengan suara native. Kling 4.0 mempertahankan fondasi itu dan terutama menambah ruang di timeline serta kontrol yang lebih presisi untuk mengaturnya.
Durasi
Kling 3.0:3–15 detikKling 4.0:3–30 detik
Satu adegan utuh yang mencakup pembuka, aksi, dan penyelesaiannya muat dalam satu take, bukan dua klip yang disambung.
Kontrol Frame
Kling 3.0:Frame pertama dan terakhirKling 4.0:Maksimal 10 keyframe
Bagian tengah shot juga dapat disematkan, misalnya saat kepala menoleh atau momen ketika produk mulai terlihat.
Kualitas gambar
Kling 3.0:Hingga 4KKling 4.0:Hingga 4K, HDR 10-bit pada 1080p dan 4K
Langit dan warna kulit bisa di-grade tanpa banding, dan detail highlight tetap terjaga.
Rasio aspek
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:Menambahkan 21:9 ultrawide
Komposisi layar lebar bergaya sinema dihasilkan langsung oleh model, tanpa pemotongan setelahnya.
Suara
Kling 3.0:Audio NativeKling 4.0:Audio stereo, lip sync lebih presisi
Garis jatuh tepat pada gerakan mulut, dan ambience memiliki ruang kiri dan kanan.
Keyframe adalah gambar diam yang disematkan pada momen tertentu dalam klip. Kling 4.0 menganimasikan jalur dari satu keyframe ke keyframe berikutnya, sehingga frame yang Anda pilih menjadi kerangka shot tersebut. Rencana empat titik yang umum tampak seperti ini:
Frame Pembuka
Atur tempat, pencahayaan, dan subjek utama. Inilah gambar pertama yang dilihat penonton.
Perubahan pertama
Kunci momen saat aksi dimulai: karakter berdiri, tutup terangkat, mobil melaju pergi.
Titik balik
Tetapkan frame saat shot berubah arah, seperti pada reveal atau sudut kamera baru.
Frame akhir
Kunci bagian akhirnya, agar klip berakhir pada komposisi yang bisa Anda potong atau perpanjang.
Dua keyframe sudah cukup untuk gerakan sederhana. Tambahkan lagi hanya di bagian yang momennya harus persis sesuai rencana: setiap keyframe tambahan mempersempit ruang yang bisa diciptakan model di antaranya.
Omni Reference memungkinkan satu tugas membawa beberapa jenis materi sumber sekaligus. Setiap jenis punya batasnya sendiri dalam total bersama 15.
| Input | Hingga | Paling cocok untuk |
|---|---|---|
| Gambar | 10 | Turnaround karakter, angle produk, lokasi, storyboard, dan style frame |
| Video | 5, gabungan 30 detik | Gerakan, koreografi, jalur kamera, dan tempo yang harus diikuti |
| Subjek | 7 | Orang, maskot, atau produk yang muncul berulang dan harus tampil sama di sepanjang video |
| Suara | Didukung | Nada dan timbre karakter yang berbicara |
Sebutkan peran setiap file dalam prompt, misalnya “gambar 2 adalah jaket, video 1 adalah gerakan kamera”. Referensi tanpa peran yang disebutkan akan saling bersaing.
Flash adalah edisi yang lebih ringan dari generasi model yang sama. Ia melepas durasi, resolusi, dan keyframe demi hasil yang lebih cepat.
Untuk karya jadi yang akan Anda publikasikan
Untuk draf, uji coba, dan volume tinggi
Rutinitas yang praktis: coba beberapa ide dengan cepat di Flash, lalu bangun ulang ide terpilih di model penuh dan tambahkan keyframe di bagian yang penting.
Masing-masing bisa menghasilkan satu take utuh berdurasi 30 detik dalam sekali jalan. Yang membedakan keduanya adalah cara Anda memberi perintah.
| Perbandingan | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| Generasi tunggal terpanjang | 30 detik | 30 detik |
| Cara utama mengarahkan | Keyframe disematkan di timeline | Tumpukan referensi plus prompt tertulis |
| Kapasitas referensi | 15 input: 10 gambar, 5 video, 7 subjek | 50 input: 30 gambar, 10 video, 10 file audio |
| Audio sebagai input | Referensi nada suara | Maksimal 10 file audio |
| Paling unggul dalam | Timing presisi untuk momen kunci, output HDR | Brief multimodal berskala besar, perencanaan adegan dengan blocking kamera |
Pilih Kling 4.0 saat momen tertentu harus muncul pada waktu tertentu. Pilih Seedance 3.0 saat brief-nya berupa kumpulan besar gambar, klip, dan suara yang perlu dipelajari model.
Prompt panjang berhasil jika setiap bagian punya posisi tetap. Tulis dengan urutan ini dan batasi setiap bagian hanya satu atau dua frasa.
1. Subjek
Seorang pesepeda dengan jas hujan kuning
2. Aksi
Mengerem, turun dari sepeda, lalu mendongak.
3. Pengaturan
di jalan berbatu yang basah saat senja
4. Kamera
sebuah tracking shot rendah yang terangkat menjadi gerakan crane
5. Terang
Papan neon terpantul di genangan air
6. Waktu
0–10 dtk berkendara, 10–20 dtk berhenti, 20–30 dtk melihat ke atas
7. Suara
hujan, desis ban, bel trem di kejauhan
8. Referensi
subjek 1 adalah pesepeda, gambar 3 adalah jalan
0–8 s: uap mengepul dari cangkir keramik di atas meja kayu yang tersinari matahari, kamera mendekat perlahan. 8–16 s: tangan barista menggeser cangkir ke depan dan fokus beralih ke latte art. 16–24 s: kursi dekat jendela, seorang wanita menyesap seruputan pertamanya dan tersenyum. 24–30 s: wide shot kafe saat golden hour. Suara: dengung penggiling kopi, gitar akustik yang tenang, cangkir diletakkan di atas tatakan.
Drone meluncur di atas sawah terasering saat matahari terbit, kabut menggenang di lembah, seorang petani berjalan di pematang. Kamera turun perlahan dan berakhir sejajar pandangan mata di samping petani. Hanya kicau burung dan angin, tanpa musik.
Dapur pada malam hari di bawah cahaya lampu praktis yang hangat. Subjek 1, seorang pria tua, bertanya: "Kau sudah menyelesaikannya?" Subjek 2, seorang gadis remaja, mengangkat buku sketsa dan menjawab: "Hampir." Medium two-shot, gerakan handheld yang ringan, room tone stereo yang sunyi.
Gambar 1 adalah sneaker, gambar 2 adalah latar belakang studio. Sneaker berputar sekali di atas turntable mengilap sementara cahaya lembut menyapu bagian mesh; kamera berakhir pada sudut hero tiga per empat. Diiringi denyut elektronik lembut.
Timeline yang lebih panjang dan kontrol keyframe paling terasa manfaatnya pada pekerjaan yang menjadikan timing dan konsistensi bagian dari brief.
Jawaban singkat soal durasi, kualitas gambar, kontrol, suara, dan posisi Kling 4.0 di antara model video lain.
Ini adalah model video utama keempat yang dirilis Kling AI, tim video generatif di Kuaishou. Cukup berikan teks, gambar statis, klip pendek, dan referensi subjek, maka ia akan menghasilkan klip berdurasi 3 hingga 30 detik dengan suara, mengikuti hingga 10 keyframe yang Anda letakkan di timeline.
Tiga puluh detik per generasi, dengan tiga detik sebagai durasi minimum. Untuk durasi yang lebih panjang, perpanjang klip yang sudah jadi; perpanjangan dapat membuat satu adegan mencapai sekitar dua menit.
Hingga 4K. Output 1080p maupun 4K sama-sama menghadirkan 10-bit HDR, jadi matahari terbenam dan warna kulit tetap aman melewati proses grading tanpa gradasi bertingkat yang terlihat. Edisi Flash yang lebih ringan hanya sampai 720p dalam 8-bit SDR.
Anda dapat menempatkan hingga 10 gambar diam pada momen tertentu dalam klip. Model memperlakukannya sebagai titik tetap dan menghasilkan gerakan di antara titik-titik tersebut.
Gunakan dua keyframe untuk pergerakan sederhana dari awal ke akhir, lalu tambahkan lebih banyak hanya pada bagian yang harus tampak persis sesuai rencana.
Maksimal 15 secara total:
Referensi suara juga dapat menentukan nada bicara suatu karakter.
Flash dioptimalkan untuk kecepatan, bukan hasil akhir. Model ini menghasilkan video hingga 20 detik pada hingga 720p dalam 8-bit SDR dan tidak menerima input frame pertama/terakhir atau multi-keyframe. Beralih ke model lengkap saat Anda membutuhkan durasi 30 detik, keyframe, kuota referensi penuh, 4K, atau HDR.
Ya. Ini menghasilkan audio stereo dua kanal bersama dengan gambar, termasuk dialog, ambience, dan efek, dengan lip sync yang lebih akurat dibandingkan model Kling sebelumnya.
Karakter dapat berbicara dalam sembilan bahasa, dengan ruang bagi beragam aksen dan dialek. Model ini juga dapat menampilkan teks di layar dalam sembilan bahasa, serta emoji.
Ya. Mode pengeditannya menerima hingga lima klip yang sudah ada, dengan total 30 detik, dan dapat mengubah subjek, latar belakang, ekspresi, sudut kamera, atau dialog berdasarkan instruksi berupa teks, gambar, atau subjek.
Ya. Selain 16:9, 9:16, dan 1:1, Kling 4.0 menambahkan bingkai ultrawide 21:9 untuk komposisi bergaya sinema.
Prompt dapat mencapai 8.000 token, cukup untuk naskah berdurasi dengan catatan kamera, dialog, dan isyarat suara. Urutan lebih penting daripada panjang: cantumkan subjek, aksi, latar, kamera, pencahayaan, waktu, dan suara dalam urutan yang sama setiap kali.
Ya, jika Anda membutuhkan klip lebih dari 15 detik, kendali atas momen di tengah pengambilan gambar, output HDR, atau frame 21:9. Untuk klip pendek dengan satu aksi, Kling 3.0 tetap menjadi pilihan yang solid.
Pilih Kling 4.0 saat ketepatan waktu jadi hal yang penting, karena keyframe-nya menentukan kapan suatu adegan terjadi. Pilih Seedance 3.0 saat Anda ingin mengarahkan hasilnya dengan banyak referensi; model ini menerima hingga 50 gambar, video, dan berkas audio dalam satu tugas.
Daftarkan orang tersebut sebagai referensi subjek, tampilkan mereka di keyframe pembuka, dan gunakan label yang sama untuk mereka di sepanjang prompt. Satu orang, satu referensi: dua foto berbeda dari karakter yang sama akan menarik hasilnya ke dua arah.