Kuaishou의 Kling AI 팀은 단 하나의 프롬프트에 운을 걸기보다 샷을 직접 연출하려는 사람들을 위해 4세대 모델 Kling 4.0을 설계했습니다. 최대 30초 길이의 타임라인에 키프레임을 고정하고, 모든 레퍼런스 파일에 역할을 부여하면 모델이 그 기준점 사이의 움직임과 카메라워크, 사운드를 채워 넣습니다.
출시 예정
이 워크스페이스에서는 곧 Kling 4.0을 사용할 수 있습니다
Kling 4.0이 연결되면 여기에서 바로 생성 기능이 활성화돼요. 아래 모델들로 같은 아이디어를 이미 구체화할 수 있고, 나중에 프롬프트를 여기로 가져오면 돼요.
다음으로 프로젝트 시작
Kling 4.0
Kling AI의 키프레임 기반 영상 모델
모델 프로필
Kling 4.0으로 한 번 생성할 때 담을 수 있는 한도를 결정하는 수치들 — 클립 길이부터 학습할 수 있는 파일 개수까지.
| 항목 | Kling 4.0 |
|---|---|
| 제작자 | Kuaishou의 동영상 플랫폼, Kling AI |
| 입력 | 텍스트, 이미지, 동영상 클립, 피사체, 음성 레퍼런스 |
| 클립 길이 | 생성 1회당 3~30초 |
| 타임라인 컨트롤 | 최대 키프레임 10개 |
| 레퍼런스 | 총 최대 15개: 이미지 10개, 동영상 5개, 피사체 7개 |
| 화질 | 최대 4K, 1080p 및 4K에서 10비트 HDR |
| 화면 비율 | 16:9, 9:16, 1:1, 21:9 울트라와이드 |
| 사운드 | 더 정밀해진 립싱크를 지원하는 2채널 스테레오 |
| 텍스트 및 음성 | 9개 언어의 화면 텍스트와 대사 |
| 프롬프트 길이 | 최대 8,000 토큰 |
| 편집 | 최대 5개의 기존 클립, 총 30초 |
| 확장 프로그램 | 시퀀스는 약 2분까지 연장할 수 있습니다. |
Kling 3.0은 이미 네이티브 사운드를 갖춘 시네마틱 샷을 만들어냈습니다. Kling 4.0은 그 기반을 유지하면서, 주로 타임라인의 여유와 더 세밀한 제어 기능을 더했습니다.
길이
Kling 3.0:3~15초Kling 4.0:3–30초
도입과 액션, 결말을 모두 갖춘 완성된 장면을 두 개의 클립을 이어 붙이는 대신 한 번의 테이크에 담아냅니다.
프레임 제어
Kling 3.0:첫 프레임과 마지막 프레임Kling 4.0:키프레임 최대 10개
샷 중간 지점도 고정할 수 있습니다. 고개를 돌리는 순간이나 제품이 드러나는 순간처럼요.
화질
Kling 3.0:최대 4KKling 4.0:최대 4K, 1080p 및 4K에서 10비트 HDR
하늘과 피부 톤은 밴딩 없이 그레이딩되고, 하이라이트 디테일도 그대로 살아납니다.
화면 비율
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:21:9 울트라와이드 추가
시네마 스타일 와이드스크린 구도가 모델에서 그대로 생성되며, 별도의 크롭 작업이 필요 없습니다.
사운드
Kling 3.0:네이티브 오디오Kling 4.0:스테레오 오디오, 더 정확한 립싱크
대사가 입 모양에 정확히 맞아떨어지고, 앰비언스에는 좌우 공간감이 살아 있습니다.
키프레임은 클립의 특정 시점에 고정된 정지 이미지입니다. Kling 4.0이 한 키프레임에서 다음 키프레임까지의 경로를 애니메이션으로 구현하기 때문에, 선택한 프레임이 곧 샷의 뼈대가 됩니다. 일반적인 4포인트 구성은 다음과 같습니다:
시작 프레임
장소와 조명, 주요 피사체를 설정하세요. 시청자가 가장 먼저 보게 되는 이미지입니다.
첫 번째 변경
동작이 시작되는 순간을 고정하세요: 캐릭터가 일어서고, 뚜껑이 열리고, 차가 출발하는 순간입니다.
전환점
리빌이나 새로운 카메라 앵글처럼 샷의 방향이 바뀌는 프레임을 고정하세요.
마지막 프레임
엔딩을 고정하면 클립이 원하는 구도로 끝나, 그 지점에서 잘라 쓰거나 이어서 확장할 수 있어요.
간단한 움직임이라면 키프레임 두 개면 충분합니다. 반드시 계획한 그대로 보여야 하는 순간에만 키프레임을 더 추가하세요. 키프레임이 하나 늘어날 때마다 모델이 그 사이를 새로 만들어낼 여지는 줄어듭니다.
Omni Reference를 사용하면 하나의 작업에 여러 종류의 소재를 동시에 담을 수 있습니다. 각 종류는 총 15개라는 공통 한도 안에서 각자의 상한을 갖습니다.
| 입력 | 최대 | 최적 사용 용도 |
|---|---|---|
| 이미지 | 10 | 캐릭터 턴어라운드, 제품 앵글, 로케이션, 스토리보드, 스타일 프레임 |
| 비디오 | 5개, 30초 합산 | 따를 모션, 안무, 카메라 경로 및 페이싱 |
| 피사체 | 7 | 전체 영상에서 동일한 모습을 유지해야 하는 반복 등장 인물, 마스코트, 제품 |
| 음성 | 지원 | 말하는 캐릭터의 톤과 음색 |
프롬프트에 각 파일의 역할을 명시하세요. 예: “이미지 2는 재킷, 동영상 1은 카메라 무브”. 역할이 명시되지 않은 레퍼런스는 서로 경쟁합니다.
Flash는 동일한 모델 세대의 경량 버전입니다. 길이와 해상도, 키프레임을 포기하는 대신 더 빠른 결과를 제공합니다.
게시할 완성본을 위한
초안, 테스트, 대량 작업용
실용적인 루틴: Flash에서 여러 아이디어를 빠르게 시도해 보고, 결국 남는 하나를 전체 모델에서 다시 만든 뒤 중요한 부분에 키프레임을 추가하세요.
각 모델은 30초 분량의 완성된 테이크를 한 번에 뽑아냅니다. 이들이 갈리는 지점은 원하는 바를 전달하는 방식입니다.
| 비교 | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| 최장 단일 생성 | 30초 | 30초 |
| 주요 조정 방법 | 타임라인에 고정된 키프레임 | 레퍼런스 스택과 텍스트 프롬프트 |
| 레퍼런스 용량 | 입력 15개: 이미지 10개, 동영상 5개, 서브젝트 7개 | 입력 50개: 이미지 30개, 동영상 10개, 오디오 파일 10개 |
| 오디오 입력 | 음성 톤 레퍼런스 | 오디오 파일 최대 10개 |
| 가장 강한 부분 | 핵심 순간의 정확한 타이밍, HDR 출력 | 대규모 멀티모달 브리프, 카메라 블로킹을 포함한 장면 기획 |
특정 순간이 특정 시점에 반드시 등장해야 한다면 Kling 4.0을 선택하세요. 모델이 학습해야 할 이미지, 클립, 사운드가 방대하게 담긴 브리프라면 Seedance 3.0을 선택하세요.
긴 프롬프트는 각 요소가 정해진 자리에 있을 때 제대로 작동합니다. 이 순서대로 작성하고, 각 요소는 한두 구절로 유지하세요.
1. 제목
노란 우비를 입은 자전거 타는 사람
2. 액션
브레이크를 잡고, 자전거에서 내려 올려다본다
3. 설정
해질녘 젖은 자갈길에서
4. 카메라
크레인 무브로 상승하는 낮은 트래킹 샷
5. 라이트
물웅덩이에 비친 네온사인
6. 타이밍
0–10초 라이딩, 10–20초 정지, 20–30초 올려다보기
7. 사운드
빗소리, 타이어가 내는 쉭 소리, 멀리서 울리는 전차 종소리
8. 레퍼런스
피사체 1은 자전거를 탄 사람이고, 이미지 3은 거리입니다.
0–8초: 햇빛이 드는 나무 카운터 위 도자기 컵에서 김이 피어오르고, 카메라가 천천히 밀고 들어간다. 8–16초: 바리스타의 손이 컵을 앞으로 밀고, 초점이 라떼 아트로 옮겨간다. 16–24초: 창가 자리, 한 여성이 첫 모금을 마시며 미소 짓는다. 24–30초: 골든 아워의 카페를 담은 와이드 샷. 사운드: 그라인더 소리, 잔잔한 어쿠스틱 기타, 받침 접시 위에 컵을 내려놓는 소리.
해 뜰 무렵, 드론이 계단식 논 위를 미끄러지듯 활공한다. 계곡마다 안개가 깔려 있고, 농부 한 명이 논둑을 따라 걷는다. 카메라는 천천히 내려와 농부 옆 눈높이에서 멈춘다. 새소리와 바람 소리만, 음악은 없다.
밤, 따뜻한 프랙티컬 조명이 켜진 주방. 피사체 1인 나이 든 남성이 묻는다: "다 끝냈니?" 피사체 2인 10대 소녀가 스케치북을 들어 보이며 답한다: "거의." 미디엄 투샷, 약간의 핸드헬드 무브먼트, 조용한 스테레오 룸 톤.
이미지 1은 스니커즈이고, 이미지 2는 스튜디오 배경입니다. 스니커즈가 광택 나는 턴테이블 위에서 한 바퀴 회전하고, 부드러운 빛이 메시 위를 훑고 지나갑니다. 카메라는 3/4 히어로 앵글로 마무리됩니다. 아래에는 잔잔한 일렉트로닉 펄스가 깔립니다.
더 긴 타임라인과 키프레임 제어는 타이밍과 일관성이 브리프에 포함된 작업에서 가장 빛을 발합니다.
길이, 화질, 제어, 사운드, 그리고 Kling 4.0이 다른 비디오 모델과 어떻게 비교되는지 짧게 정리했습니다.
Kuaishou의 생성형 비디오 팀인 Kling AI가 출시한 네 번째 주요 비디오 모델입니다. 텍스트, 스틸 이미지, 짧은 클립, 피사체 참조를 입력하면 사운드가 포함된 3~30초 클립을 반환하며, 타임라인에 배치한 최대 10개의 키프레임을 따릅니다.
생성 한 번에 최대 30초이며, 최소 3초입니다. 더 긴 영상이 필요하다면 완성된 클립을 연장하세요. 연장 기능을 사용하면 한 장면을 약 2분까지 늘릴 수 있습니다.
최대 4K. 1080p와 4K 출력 모두 10-bit HDR을 지원하므로, 노을과 피부 톤이 그레이딩을 거쳐도 눈에 띄는 계단 현상 없이 그대로 살아납니다. 더 가벼운 Flash 에디션은 720p 8-bit SDR까지만 지원합니다.
클립의 원하는 시점에 최대 10장의 스틸 이미지를 배치할 수 있습니다. 모델은 이 이미지를 고정점으로 삼아 그 사이의 움직임을 생성합니다.
단순한 시작-끝 이동에는 키프레임 두 개면 충분하며, 특정 순간을 계획한 그대로 재현해야 할 때만 키프레임을 추가하세요.
총 최대 15개:
음성 레퍼런스로 말하는 캐릭터의 톤을 설정할 수도 있습니다.
Flash는 완성도보다 속도에 맞춰 튜닝되었습니다. 최대 20초, 최대 720p 해상도의 8비트 SDR로 생성하며 첫/마지막 프레임이나 멀티 키프레임 입력은 지원하지 않습니다. 30초 길이, 키프레임, 전체 레퍼런스 한도, 4K 또는 HDR이 필요할 때는 풀 모델로 전환하세요.
네. 영상과 함께 대사, 환경음, 효과음을 포함한 2채널 스테레오 오디오를 생성하며, 이전 Kling 모델보다 립싱크 정확도가 더 높습니다.
캐릭터는 9개 언어로 말할 수 있으며 억양과 방언도 다양하게 표현할 수 있습니다. 모델은 9개 언어의 화면 텍스트는 물론 이모지까지 렌더링할 수 있습니다.
네. 해당 편집 모드는 기존 클립을 최대 5개까지, 총 30초 분량으로 사용할 수 있고, 텍스트나 이미지, 피사체 지시를 통해 피사체, 배경, 표정, 카메라 앵글, 대사까지 바꿀 수 있어요.
네. 16:9, 9:16, 1:1 외에도 Kling 4.0은 시네마 스타일 구도를 위한 21:9 울트라와이드 프레임을 지원합니다.
프롬프트는 최대 8,000 토큰까지 작성할 수 있으며, 카메라 노트와 대사, 사운드 큐가 담긴 타이밍 스크립트를 만들기에 충분한 분량입니다. 길이보다 중요한 것은 순서입니다. 피사체, 동작, 배경, 카메라, 조명, 타이밍, 사운드를 항상 같은 순서로 나열하세요.
네, 15초보다 긴 클립이나 샷 중간 순간에 대한 제어, HDR 출력, 21:9 프레임이 필요하다면 그렇습니다. 짧은 단일 동작 클립에는 Kling 3.0이 여전히 좋은 선택입니다.
정확한 타이밍이 중요할 때는 Kling 4.0을 선택하세요. 키프레임이 언제 어떤 일이 일어날지 고정해 주기 때문입니다. 다양한 레퍼런스로 결과를 원하는 방향으로 이끌고 싶다면 Seedance 3.0을 선택하세요. 한 작업에서 이미지, 동영상, 오디오 파일을 최대 50개까지 받을 수 있습니다.
인물을 피사체 레퍼런스로 등록하고, 첫 키프레임에 등장시키고, 프롬프트 전반에서 동일한 레이블로 지칭하세요. 한 인물, 하나의 레퍼런스: 같은 캐릭터의 서로 다른 사진 두 장은 결과를 두 방향으로 끌어당깁니다.