Команда Kling AI від Kuaishou розробила свою модель четвертого покоління Kling 4.0 для тих, хто хоче керувати кадром, а не робити ставку на один промпт. Ви закріплюєте ключові кадри на таймлайні до 30 секунд, даєте кожному референс-файлу своє завдання — а модель заповнює рух, роботу камери та звук між цими опорними точками.
Незабаром
Цей робочий простір скоро працюватиме на Kling 4.0
Генерація тут увімкнеться, щойно Kling 4.0 буде підключено. Ту саму ідею вже можна опрацювати з моделями нижче, а промпт перенести сюди пізніше.
Почати проєкт з
Kling 4.0
Відеомодель від Kling AI на основі ключових кадрів
Профіль моделі
Цифри, які визначають, скільки вміщає одна генерація Kling 4.0 — від тривалості кліпу до кількості файлів, на яких вона може навчатися.
| Елемент | Kling 4.0 |
|---|---|
| Створено | Kling AI, відеоплатформа Kuaishou |
| Вхідні дані | Текст, зображення, відеокліпи, суб'єкти та голосові референси |
| Тривалість кліпу | від 3 до 30 секунд на генерацію |
| Керування таймлайном | До 10 ключових кадрів |
| Джерела | Усього до 15: 10 зображень, 5 відео, 7 суб’єктів |
| Якість зображення | До 4K; 10-бітний HDR у 1080p і 4K |
| Співвідношення сторін | 16:9, 9:16, 1:1 та ультраширокий 21:9 |
| Звук | Двоканальне стерео з точнішою синхронізацією губ |
| Текст і мовлення | Текст на екрані та діалоги дев'ятьма мовами |
| Довжина промпту | До 8,000 токенів |
| Редагування | До 5 наявних кліпів, загалом 30 секунд |
| Розширення | Послідовність можна продовжити приблизно до двох хвилин |
Kling 3.0 уже створював кінематографічні кадри з вбудованим звуком. Kling 4.0 зберігає цю основу й передусім додає більше простору на таймлайні та точніший контроль над ним.
Тривалість
Kling 3.0:3–15 секундKling 4.0:3–30 секунд
Повноцінна сцена із зав'язкою, дією та розв'язкою вміщується в один дубль, а не в два склеєні кліпи.
Керування кадрами
Kling 3.0:Перший і останній кадрKling 4.0:До 10 ключових кадрів
Середину кадру також можна закріпити — наприклад, поворот голови або момент, коли показують продукт.
Якість зображення
Kling 3.0:До 4KKling 4.0:До 4K, 10-бітний HDR у 1080p і 4K
Небо й тони шкіри градуюються без бандингу, а світлі ділянки зберігають деталізацію.
Співвідношення сторін
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:Додає надширокий формат 21:9
Широкоекранні композиції в кінематографічному стилі одразу виходять із моделі — без подальшого обрізання.
Звук
Kling 3.0:Нативне аудіоKling 4.0:Стереозвук, точніша синхронізація губ
Репліки лягають на рух губ, а фоновий звук має простір ліворуч і праворуч.
Ключовий кадр — це статичне зображення, прив'язане до конкретного моменту кліпу. Kling 4.0 анімує шлях від одного ключового кадру до наступного, тож обрані вами кадри стають скелетом сцени. Типовий план із чотирьох точок виглядає так:
Початковий кадр
Задайте місце, освітлення та головний об’єкт. Це перше зображення, яке побачить глядач.
Перша зміна
Зафіксуйте момент початку дії: персонаж встає, кришка піднімається, автомобіль від'їжджає.
Переломний момент
Зафіксуйте кадр у місці, де змінюється напрямок знімання — наприклад, під час розкриття або зміни кута камери.
Кінцевий кадр
Заблокуйте кінцівку, щоб кліп завершувався на композиції, від якої можна різати або яку можна продовжити.
Для простого руху достатньо двох ключових кадрів. Додавайте більше лише там, де момент має виглядати точно за задумом: кожен зайвий ключовий кадр звужує те, що модель може вигадати між ними.
Omni Reference дає змогу одному завданню одночасно приймати кілька типів вихідних матеріалів. Для кожного типу діє власне обмеження в межах спільного ліміту 15.
| Введення | До | Найкраще підходить для |
|---|---|---|
| Зображення | 10 | Розгортки персонажів, ракурси продукту, локації, розкадрування та стильові кадри |
| Відео | 5, 30 с разом | Рух, хореографія, траєкторії руху камери та темп, яких потрібно дотримуватися |
| Суб'єкти | 7 | Повторювані персонажі, маскоти або продукти, які мають виглядати однаково впродовж усього відео |
| Голос | Підтримується | Тон і тембр мовленнєвого персонажа |
Укажіть роль кожного файлу в промпті, наприклад: «зображення 2 — це куртка, відео 1 — це рух камери». Референси без указаної ролі конкурують між собою.
Flash — це полегшена версія того самого покоління моделей. Вона поступається тривалістю, роздільною здатністю та ключовими кадрами в обмін на швидші результати.
Для готових робіт, які ви плануєте опублікувати
Для чернеток, тестів і великих обсягів
Практичний підхід: швидко спробуйте кілька ідей у Flash, а потім відтворіть той варіант, який залишаєте, у повноцінній моделі та додайте ключові кадри там, де це важливо.
Кожен може видати повний 30-секундний дубль за один раз. А от різняться вони тим, як ви ставите їм завдання.
| Порівняння | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| Найдовша одинична генерація | 30 секунд | 30 секунд |
| Основний спосіб керування | Ключові кадри, закріплені на таймлайні | Стек референсів і текстовий промпт |
| Ємність референсів | 15 вхідних даних: 10 зображень, 5 відео, 7 суб’єктів | 50 входів: 30 зображень, 10 відео, 10 аудіофайлів |
| Аудіо як вхідні дані | Референси тону голосу | До 10 аудіофайлів |
| Найсильніший у | Точний тайминг ключових моментів, виведення в HDR | Великі мультимодальні брифи, планування сцен із розташуванням камери |
Обирайте Kling 4.0, коли конкретні моменти мають з’являтися у визначений час. Обирайте Seedance 3.0, коли бриф — це великий набір зображень, кліпів і звуку, з якого модель має навчатися.
Довгі промпти працюють, коли кожна частина має своє чітке місце. Пишіть їх у цьому порядку й обмежуйте кожну частину однією-двома фразами.
1. Тема
Велосипедист у жовтому дощовику
2. Дія
гальмує, сходить з велосипеда й дивиться вгору
3. Налаштування
на мокрій брукованій вулиці в сутінках
4. Камера
низький трекінговий кадр, що піднімається, переходячи в рух крана
5. Світла
неонові вивіски, відбиті в калюжах
6. Таймінг
0–10 с — їзда, 10–20 с — зупинка, 20–30 с — погляд угору
7. Звук
дощ, шипіння шин, далекий трамвайний дзвінок
8. Референси
Суб'єкт 1 — це велосипедист, зображення 3 — це вулиця
0–8 с: пара здіймається над керамічною чашкою на залитій сонцем дерев'яній стійці, повільний наїзд камери. 8–16 с: рука баристи висуває чашку вперед, і фокус переходить на латте-арт. 16–24 с: місце біля вікна, жінка робить перший ковток і всміхається. 24–30 с: загальний план кафе в золоту годину. Звук: гудіння кавомолки, тиха акустична гітара, чашка, поставлена на блюдце.
Дрон лине над рисовими терасами на світанку, туман лежить у долинах, один фермер іде по гребеню. Камера повільно опускається й зупиняється на рівні очей поряд із фермером. Лише спів птахів і вітер, без музики.
Кухня вночі при теплому практичному світлі. Суб'єкт 1, чоловік старшого віку, запитує: «Ти закінчила?» Суб'єкт 2, дівчина-підліток, піднімає альбом для малювання й відповідає: «Майже.» Середній план із двома персонажами, легкий рух камери з рук, тихий стереофонічний шум кімнати.
Зображення 1 — кросівок, зображення 2 — студійний фон. Кросівок робить один оберт на глянсовому поворотному столику, а м’яке світло ковзає по сітці; камера зупиняється на героїчному ракурсі три чверті. Під усім — м’який електронний пульс.
Довший таймлайн і керування ключовими кадрами дають найбільшу віддачу в роботі, де таймінг і узгодженість є частиною брифу.
Короткі відповіді про тривалість, якість зображення, контроль, звук і про те, як Kling 4.0 виглядає на тлі інших відеомоделей.
Це четверта велика відеомодель, випущена Kling AI — командою генеративного відео в Kuaishou. Надайте їй текст, статичні зображення, короткі кліпи та референси суб'єктів — і вона повертає кліп тривалістю від 3 до 30 секунд зі звуком, орієнтуючись щонайбільше на 10 ключових кадрів, які ви розміщуєте на таймлайні.
Тридцять секунд на одну генерацію, мінімум — три секунди. Якщо потрібно довше, продовжте готовий кліп — за допомогою продовжень одну сцену можна розтягнути приблизно до двох хвилин.
До 4K. І вихід 1080p, і вихід 4K мають 10-бітний HDR, тож заходи сонця та відтінки шкіри витримують кольорокорекцію без видимих сходинок. Полегшена версія Flash обмежується 720p у 8-бітному SDR.
Ви розміщуєте до 10 статичних зображень у вибраних моментах кліпу. Модель сприймає їх як фіксовані точки й генерує рух між ними.
Для простого переходу від початку до кінця використовуйте два ключові кадри, а більше додавайте лише там, де момент має виглядати точно за задумом.
Загалом до 15:
Голосові референси також можуть задавати тон персонажа, що говорить.
Flash оптимізовано для швидкості, а не для якості опрацювання. Він генерує до 20 секунд у роздільності до 720p у 8-бітному SDR і не приймає на вхід перший/останній кадр чи кілька ключових кадрів. Перемикайтеся на повну модель, коли потрібні 30 секунд, ключові кадри, повний ліміт референсів, 4K або HDR.
Так. Він створює двоканальне стереоаудіо разом із зображенням, включно з діалогами, атмосферним звуком та ефектами, із точнішою синхронізацією губ, ніж у раніших моделях Kling.
Персонажі можуть розмовляти дев'ятьма мовами, передаючи різні акценти й діалекти. Модель також уміє відображати текст на екрані дев'ятьма мовами, а також емодзі.
Так. Його режим редагування приймає до п'яти наявних кліпів загальною тривалістю 30 секунд і може змінювати об'єкт, фон, вираз обличчя, кут камери або репліку діалогу за текстом, зображенням чи інструкцією щодо об'єкта.
Так. Окрім 16:9, 9:16 і 1:1, Kling 4.0 додає надширокий кадр 21:9 для композицій у кінематографічному стилі.
Промпти можуть сягати 8,000 токенів — цього достатньо для сценарію з хронометражем, нотатками про камеру, діалогами та звуковими позначками. Порядок важливіший за довжину: перелічуйте суб'єкт, дію, оточення, камеру, світло, тайминг і звук щоразу в одній і тій самій послідовності.
Так, якщо вам потрібні кліпи довші за 15 секунд, контроль над моментами в середині сцени, HDR-виведення або кадр у форматі 21:9. Для коротких кліпів з однією дією Kling 3.0 залишається надійним вибором.
Оберіть Kling 4.0, коли важлива точна синхронізація в часі, адже його ключові кадри визначають, що і коли відбувається. Оберіть Seedance 3.0, коли хочете керувати результатом за допомогою великого набору референсів; він приймає до 50 зображень, відео та аудіофайлів в одному завданні.
Зареєструйте людину як референс суб'єкта, покажіть її в початковому ключовому кадрі та згадуйте її під тим самим позначенням у всьому промпті. Одна людина — один референс: два різні фото одного персонажа розтягують результат у різні боки.