Kling 4.0 是快手 Kling AI 團隊推出的第四代影片模型,專為想掌控鏡頭、而非只憑一句提示詞生成影片的創作者打造:在長達 30 秒的時間軸上釘選關鍵影格,為每份參考素材指定用途,中間的動作、運鏡與聲音則交由模型補齊。
即將上線
本工作台即將接入 Kling 4.0
Kling 4.0 串接後,這裡就會直接開放生成。現在可以先透過下方的模型把創意做出來,之後再把提示詞搬過來。
先用這些模型開始
Kling 4.0
Kling AI 的關鍵影格影片模型
模型檔案
單次生成能容納多少內容,從片長到可參考的素材數量,皆由以下這些數字決定。
| 專案 | Kling 4.0 |
|---|---|
| 出品方 | Kling AI(快手旗下影片平台) |
| 輸入 | 文字、圖片、影片片段、主體與音色參考 |
| 片長 | 單次 3–30 秒 |
| 時間軸控制 | 最多 10 個關鍵影格 |
| 參考素材 | 合計最多 15 個:圖片 10、影片 5、主體 7 |
| 畫質 | 最高 4K;1080p 與 4K 支援 10-bit HDR |
| 畫面比例 | 16:9、9:16、1:1,以及 21:9 超寬 |
| 聲音 | 雙聲道立體聲,唇形同步更精準 |
| 文字與語音 | 畫面文字與台詞各支援 9 種語言 |
| 提示詞長度 | 最多 8,000 tokens |
| 編輯 | 最多 5 段現有影片,合計 30 秒 |
| 續寫 | 可將一段場景延伸至約 2 分鐘 |
Kling 3.0 已能生成帶原生音訊的電影感鏡頭。Kling 4.0 保留了這個底子,主要是把時間軸拉長,並讓你更精細地控制它。
片長
Kling 3.0:3–15 秒Kling 4.0:3–30 秒
鋪陳、動作、收尾,一整場戲能在一個鏡頭內完成,不必再拼接兩段。
畫面控制
Kling 3.0:首幀與尾幀Kling 4.0:最多 10 個關鍵影格
鏡頭中段也能鎖定,例如人物回頭的一瞬、產品揭曉的那一刻。
畫質
Kling 3.0:最高 4KKling 4.0:最高 4K,1080p 與 4K 支援 10-bit HDR
調整天空與膚色時不會出現斷層,亮部細節也能完整保留。
畫面比例
Kling 3.0:16:9、9:16、1:1Kling 4.0:新增 21:9 超寬
直接生成電影感的寬銀幕構圖,後製無須再裁切。
聲音
Kling 3.0:原生音訊Kling 4.0:立體聲,嘴型更精準
台詞對得上嘴型,環境音也有了左右空間感。
關鍵影格就是固定在某一時間點上的一張靜態畫面。Kling 4.0 會生成從一個關鍵影格到下一個關鍵影格的過程,因此你挑選的這幾格就是整個鏡頭的骨架。常見的四點規劃如下:
開場畫面
交代場景、光線與主角,這是觀眾看到的第一眼。
第一次變化
釘選動作開始的那一刻:人物起身、蓋子掀開、汽車駛離。
轉折點
固定鏡頭轉向的畫面,例如揭曉答案或切換至另一個機位。
結尾畫面
鎖定結尾構圖,方便接續下一個鏡頭或繼續續寫。
簡單的動態只要兩個關鍵影格就夠了。只在必須完全一致的時間點才再加:每多一個關鍵影格,模型在兩個影格之間自由發揮的空間就少一些。
全能参考(Omni Reference)允許單一任務同時帶上多種類型的素材,每種類型在 15 個的總額度中各有上限。
| 素材類型 | 上限 | 最適合用來 |
|---|---|---|
| 圖片 | 10 | 人物三視圖、產品各角度、場景、分鏡與風格參考 |
| 影片 | 5,合計 30 秒 | 讓模型參考動作、舞蹈、運鏡路線與節奏 |
| 主體 | 7 | 反覆出現、必須前後一致的人物、吉祥物或產品 |
| 音色 | 支援 | 說話角色的音色與語氣 |
在提示詞中明確寫出每份素材的用途,例如「圖 2 是外套,影片 1 是運鏡」。未寫明用途的素材會互相干擾。
Flash 是同一代模型的輕量版:犧牲影片長度、清晰度與關鍵影格,換取更快的生成速度。
適合正式發佈的成品影片
適合草稿、試錯與批次產出
較為省時的做法:先在 Flash 中快速嘗試幾個方向,選定其中一個後再用完整版重新製作,並在關鍵處加入關鍵影格。
兩者都能一次生成完整的 30 秒鏡頭,差異在於你如何告訴它們你想要什麼。
| 比較項目 | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| 單次最長 | 30 秒 | 30 秒 |
| 主要控制方式 | 在時間軸上釘選關鍵影格 | 參考素材組合加上文字提示 |
| 參考素材容量 | 15 個:圖片 10、影片 5、主體 7 | 50 個:圖片 30、影片 10、音訊 10 |
| 音訊作為輸入 | 音色參考 | 最多 10 段音訊 |
| 最擅長 | 關鍵時刻精準對拍、HDR 交付 | 大量多模態素材、含機位調度的場景規劃 |
若要讓特定畫面準時出現在特定時間點,選 Kling 4.0;若手上有大量圖片、片段與聲音,希望模型從中學習,選 Seedance 3.0。
長提示詞要好用,關鍵在於每個部分都有固定的位置。依照下列順序撰寫,每個部分一兩句就夠。
1. 主體
一位穿黃色雨衣的自行車騎士
2. 動作
煞車、下車、抬頭看
3. 場景
黃昏時分濕漉漉的石板街
4. 運鏡
低機位跟拍,隨後升起轉為搖臂鏡頭。
5. 光線
霓虹招牌倒映在水窪裡
6. 節奏
0–10 秒騎行,10–20 秒停下,20–30 秒抬頭
7. 聲音
雨聲、輪胎摩擦聲、遠處電車鈴
8. 參考
主體 1 是騎乘者,圖 3 是街道
0–8 秒:陽光灑在木質吧檯上,陶瓷杯冒著熱氣,鏡頭緩慢推近。8–16 秒:咖啡師將杯子推向前,焦點轉到拉花上。16–24 秒:靠窗座位,一位女士喝下第一口並微笑。24–30 秒:黃金時段的咖啡館全景。聲音:磨豆機的嗡嗡聲、輕柔的木吉他、杯子放回杯碟上的輕響。
日出時無人機掠過梯田,山谷裡籠著薄霧,一位農人沿著田埂走著。鏡頭緩緩下降,最後停在農人身旁的平視高度。只有鳥鳴和風聲,不加音樂。
夜晚的廚房,暖色實景光。主體 1 是一位年長男士,問:「畫完了嗎?」主體 2 是一個十幾歲的女孩,舉起素描本回答:「快了。」中景雙人鏡頭,輕微手持晃動,安靜的立體聲室內底噪。
圖 1 是球鞋,圖 2 是攝影棚背景。球鞋在亮面轉台上轉一圈,柔光掃過網面,鏡頭停在四分之三側的主視角。底下一層柔和的電子節拍。
更長的時間軸與關鍵影格控制,最適合對卡點與一致性有要求的工作。
關於片長、畫質、控制方式、聲音,以及 Kling 4.0 與其他影片模型該如何選擇的簡短解答。
它是快手 Kling AI 團隊推出的第四代主力影片模型。只要輸入文字、圖片、短影片片段和主體參考,即可產出 3–30 秒、帶有聲音的影片,並依你在時間軸上放置的最多 10 個關鍵影格來生成。
單次生成最長 30 秒,最短 3 秒。較長的內容可在完成影片的基礎上延伸生成,單一場景最多可延伸至約 2 分鐘。
最高 4K。1080p 與 4K 兩檔皆支援 10-bit HDR,在日落、膚色這類漸層調色時不容易出現斷層。輕量版 Flash 最高 720p,為 8-bit SDR。
在影片的不同時間點放入最多 10 張靜態畫面,模型會將它們視為固定點,生成中間的運動過程。
簡單的全程運動放兩張就足夠;只有必須精確呈現的時刻,才需要再增加。
合計最多 15 個:
另外也可以用音色參考來設定說話角色的聲音。
Flash 講求速度,而非精確度:最長 20 秒、最高 720p(8-bit SDR),也不支援首尾影格與多關鍵影格。若需要 30 秒片長、關鍵影格、完整的參考額度、4K 或 HDR,請改用完整版。
有。畫面與雙聲道立體聲一同生成,涵蓋台詞、環境音與音效,嘴型同步比先前的 Kling 模型更精準。
角色台詞支援 9 種語言,並能呈現不同口音與方言;畫面中的文字同樣支援 9 種語言,還可生成 emoji。
能。編輯模式一次最多可接收 5 段現有影片(合計 30 秒),可依文字、圖片或主體指令替換主體、背景、表情、機位,或修改一句台詞。
支援。除了 16:9、9:16 和 1:1,Kling 4.0 新增了 21:9 超寬畫幅,適合電影感的寬銀幕構圖。
最多 8,000 tokens,足以寫出一份包含時間點、運鏡說明、台詞與聲音提示的完整腳本。比長度更重要的是順序:每次都依主體、動作、場景、運鏡、光線、節奏、聲音的順序來寫。
如果你需要超過 15 秒的片長、想控制鏡頭中段的畫面,或是需要 HDR 輸出、21:9 畫幅,那就值得。如果只做簡短的單一動作鏡頭,Kling 3.0 依然夠用。
若對時間點的精準度要求較高,建議選擇 Kling 4.0,它的關鍵影格能精確鎖定每個時間點會發生什麼。若想以大量參考素材引導生成結果,建議選擇 Seedance 3.0,每個任務最多可放入 50 個圖片、影片與音訊。
將這個人登記為主體參考,讓他出現在開場關鍵影格裡,並在整段提示詞中始終以同一個稱呼指稱他。一個人只配一份參考:同一角色給兩張不同的照片,會把結果往兩個方向拉。