可灵 4.0(Kling 4.0)是快手可灵 AI 团队的第四代视频模型,面向希望掌控镜头、而不是只靠一句提示词出片的创作者:在最长 30 秒的时间线上钉住关键帧,给每份参考素材分配用途,模型负责补齐其间的动作、运镜和声音。
Kling 4.0
可灵 AI 的关键帧视频模型
模型档案
一次生成能装下多少内容,从片长到可参考的素材数量,都由下面这些数字决定。
| 项目 | 可灵 4.0 |
|---|---|
| 出品方 | 可灵 AI(快手旗下视频平台) |
| 输入 | 文字、图片、视频片段、主体和音色参考 |
| 片长 | 单次 3–30 秒 |
| 时间线控制 | 最多 10 个关键帧 |
| 参考素材 | 合计最多 15 个:图片 10、视频 5、主体 7 |
| 画质 | 最高 4K;1080p 与 4K 支持 10-bit HDR |
| 画幅 | 16:9、9:16、1:1,以及 21:9 超宽 |
| 声音 | 双声道立体声,口型同步更准 |
| 文字与语音 | 画面文字和台词各支持 9 种语言 |
| 提示词长度 | 最多 8,000 tokens |
| 编辑 | 最多 5 段已有视频,合计 30 秒 |
| 续写 | 可把一段场景续写到约 2 分钟 |
可灵 3.0 已经能生成带原生声音的电影感镜头。4.0 保留了这个底子,主要把时间线拉长,并让你能更细地控制它。
片长
可灵 3.0:3–15 秒可灵 4.0:3–30 秒
铺垫、动作、收尾一整场戏能在一个镜头里完成,不必再拼接两段。
画面控制
可灵 3.0:首帧和尾帧可灵 4.0:最多 10 个关键帧
镜头中段也能钉住,比如人物回头的一瞬、产品揭晓的那一刻。
画质
可灵 3.0:最高 4K可灵 4.0:最高 4K,1080p 与 4K 带 10-bit HDR
天空和肤色调色时不出断层,高光细节也保得住。
画幅
可灵 3.0:16:9、9:16、1:1可灵 4.0:新增 21:9 超宽
电影感的宽银幕构图直接生成,后期不用再裁。
声音
可灵 3.0:原生音频可灵 4.0:立体声,口型更准
台词对得上嘴型,环境声有了左右空间感。
关键帧就是钉在某个时间点上的一张静态画面。可灵 4.0 会生成从一个关键帧到下一个关键帧的过程,所以你挑的这几帧就是整个镜头的骨架。常见的四点规划如下:
开场画面
交代场景、光线和主角,这是观众看到的第一眼。
第一次变化
钉住动作开始的那一刻:人物起身、盖子掀开、汽车驶离。
转折点
固定镜头转向的画面,比如揭晓答案或换一个机位。
结尾画面
锁定结尾构图,方便接下一个镜头或继续续写。
简单的运动两个关键帧就够了。只在必须一模一样的时刻再加:每多一个关键帧,模型在两帧之间自由发挥的空间就少一点。
全能参考(Omni Reference)允许一个任务同时带上几类素材,每一类在 15 个的总额里各有上限。
| 素材类型 | 上限 | 最适合用来 |
|---|---|---|
| 图片 | 10 | 人物三视图、产品各角度、场景、分镜和风格参考 |
| 视频 | 5,合计 30 秒 | 让模型参照动作、舞蹈、运镜路线和节奏 |
| 主体 | 7 | 反复出现、必须前后一致的人物、吉祥物或产品 |
| 音色 | 支持 | 说话角色的音色与语气 |
在提示词里写明每份素材的用途,例如「图 2 是外套,视频 1 是运镜」。没写清用途的素材会相互干扰。
Flash 是同一代模型的轻量版:牺牲片长、清晰度和关键帧,换来更快出结果。
适合要正式发布的成片
适合草稿、试错和批量产出
比较省事的做法:先在 Flash 里快速试几个方向,选定一个后再用完整版重做,并在关键处加上关键帧。
两者都能一次生成完整的 30 秒镜头,分歧在于你怎么告诉它们要什么。
| 对比项 | 可灵 4.0 | Seedance 3.0 |
|---|---|---|
| 单次最长 | 30 秒 | 30 秒 |
| 主要控制方式 | 在时间线上钉关键帧 | 参考素材组合加文字提示 |
| 参考素材容量 | 15 个:图片 10、视频 5、主体 7 | 50 个:图片 30、视频 10、音频 10 |
| 音频作为输入 | 音色参考 | 最多 10 段音频 |
| 最擅长 | 关键时刻卡点精准、HDR 交付 | 大量多模态素材、带机位调度的场景规划 |
要让特定画面准时出现在特定时间点,选可灵 4.0;手上是一大堆图片、片段和声音,希望模型从中学习,选 Seedance 3.0。
长提示词要好用,关键是每部分都有固定位置。按下面的顺序写,每部分一两句就够。
1. 主体
一位穿黄色雨衣的骑行者
2. 动作
刹车、下车、抬头看
3. 场景
黄昏时湿漉漉的石板街
4. 运镜
低机位跟拍,随后升起变成摇臂镜头
5. 光线
霓虹招牌倒映在水洼里
6. 节奏
0–10 秒骑行,10–20 秒停下,20–30 秒抬头
7. 声音
雨声、轮胎摩擦声、远处电车铃
8. 参考
主体 1 是骑行者,图 3 是街道
0–8 秒:阳光照在木质吧台上,陶瓷杯冒着热气,镜头缓慢推近。8–16 秒:咖啡师把杯子推向前,焦点转到拉花上。16–24 秒:靠窗座位,一位女士喝下第一口并微笑。24–30 秒:黄金时段的咖啡馆全景。声音:磨豆机的嗡嗡声、轻柔的木吉他、杯子放回碟上的轻响。
日出时无人机掠过梯田,山谷里笼着薄雾,一位农人沿田埂走着。镜头缓缓下降,最后停在农人身旁的平视高度。只有鸟鸣和风声,不加音乐。
夜晚的厨房,暖色实景光。主体 1 是一位年长男士,问:「画完了吗?」主体 2 是一个十几岁的女孩,举起素描本回答:「快了。」中景双人镜头,轻微手持晃动,安静的立体声室内底噪。
图 1 是球鞋,图 2 是摄影棚背景。球鞋在亮面转台上转一圈,柔光扫过网面,镜头停在四分之三侧的主视角。底下一层柔和的电子节拍。
更长的时间线和关键帧控制,最适合那些对卡点和一致性有要求的工作。
关于片长、画质、控制方式、声音,以及可灵 4.0 与其他视频模型怎么选的简短回答。
它是快手可灵 AI 团队推出的第四代主力视频模型。输入文字、图片、短视频片段和主体参考,它会生成 3–30 秒、带声音的视频,并按你在时间线上放的最多 10 个关键帧来走。
单次生成最长 30 秒,最短 3 秒。更长的内容可以在成片基础上续写,一个场景最多能延展到约 2 分钟。
最高 4K。1080p 和 4K 两档都带 10-bit HDR,日落、肤色这类渐变调色时不容易出现断层。轻量版 Flash 最高 720p,为 8-bit SDR。
在视频的不同时间点放最多 10 张静态画面,模型把它们当作固定点,生成中间的运动过程。
简单的从头到尾运动放两个就够;只有必须精确呈现的时刻才需要再加。
合计最多 15 个:
另外还可以用音色参考来设定说话角色的声音。
Flash 追求的是速度而不是精度:最长 20 秒、最高 720p(8-bit SDR),也不支持首尾帧和多关键帧。需要 30 秒片长、关键帧、完整的参考额度、4K 或 HDR 时,换用完整版。
带。画面和双声道立体声一起生成,包括台词、环境声和音效,口型同步比之前的可灵模型更准。
角色台词支持 9 种语言,并能体现不同口音和方言;画面里的文字同样支持 9 种语言,还能生成 emoji。
能。编辑模式一次最多接收 5 段已有视频(合计 30 秒),可以按文字、图片或主体指令替换主体、背景、表情、机位,或者改一句台词。
支持。除了 16:9、9:16 和 1:1,可灵 4.0 新增了 21:9 超宽画幅,适合电影感的宽银幕构图。
最多 8,000 tokens,足够写一份带时间点、运镜说明、台词和声音提示的完整脚本。比长度更重要的是顺序:每次都按主体、动作、场景、运镜、光线、节奏、声音的顺序写。
如果你需要超过 15 秒的片长、想控制镜头中段的画面、要 HDR 输出或 21:9 画幅,值得。只做简短的单一动作镜头,可灵 3.0 依然够用。
卡点要求高时选可灵 4.0,它的关键帧能定死每个时间点发生什么。想用大量参考素材来引导结果时选 Seedance 3.0,一个任务最多可放 50 个图片、视频和音频。
把这个人登记为主体参考,让他出现在开场关键帧里,并在整段提示词里始终用同一个称呼指代他。一个人只配一份参考:同一角色给两张不同的照片,会把结果往两个方向拉。