KuaishouのKling AIチームが設計した第4世代モデル「Kling 4.0」は、ひとつのプロンプトに賭けるのではなく、ショットを自ら演出したい人のために作られました。最大30秒のタイムライン上にキーフレームを打ち込み、参照ファイルごとに役割を与えれば、モデルが各アンカーの間の動き、カメラワーク、サウンドを補完します。
近日公開
このワークスペースではまもなく Kling 4.0 が利用可能になります
Kling 4.0が接続され次第、ここで生成が使えるようになります。同じアイデアは下記のモデルですでに形にできますので、プロンプトは後からそのまま持ち越せます。
プロジェクトを開始:
Kling 4.0
Kling AIによるキーフレーム駆動型ビデオモデル
モデルプロフィール
Kling 4.0の1回の生成でどこまで対応できるかを決める数値。クリップの長さから、学習に使えるファイル数まで。
| アイテム | Kling 4.0 |
|---|---|
| 作成者 | Kuaishouの動画プラットフォーム、Kling AI |
| 入力 | テキスト、画像、動画クリップ、被写体、音声リファレンス |
| クリップの長さ | 1回の生成につき3~30秒 |
| タイムライン操作 | 最大10キーフレーム |
| 参照 | 合計最大15点:画像10枚、動画5本、被写体7件 |
| 画質 | 最大4K、1080pおよび4Kで10bit HDR |
| アスペクト比 | 16:9、9:16、1:1、21:9 ウルトラワイド |
| サウンド | 2チャンネルステレオと、より精度の高いリップシンク |
| テキストと音声 | 9言語のオンスクリーンテキストとセリフ |
| プロンプトの長さ | 最大8,000トークン |
| 編集中 | 既存クリップは最大5つ、合計30秒まで |
| 拡張機能 | シーケンスは約2分まで延長できます |
Kling 3.0はすでに、ネイティブ音声付きのシネマティックなショットを生成していました。Kling 4.0はその基盤を維持しつつ、主にタイムラインの余裕と、それをより細かくコントロールできる機能を追加しています。
長さ
Kling 3.0:3〜15秒Kling 4.0:3〜30秒
設定・アクション・結末を備えたシーン全体が、2つのクリップをつなぎ合わせるのではなく、ワンテイクに収まります。
フレームコントロール
Kling 3.0:最初と最後のフレームKling 4.0:最大10個のキーフレーム
ショットの中間もピン留めできます。たとえば、首を振る動きや、商品が現れる瞬間などです。
画質
Kling 3.0:最大4KKling 4.0:最大4K、1080pおよび4Kで10ビットHDRに対応
空や肌のトーンもバンディングなしでグレーディングでき、ハイライトのディテールも保持されます。
アスペクト比
Kling 3.0:16:9, 9:16, 1:1Kling 4.0:21:9ウルトラワイドを追加
シネマ風のワイドスクリーン構図がモデルからそのまま生成され、後からのトリミングは不要です。
サウンド
Kling 3.0:ネイティブオーディオKling 4.0:ステレオ音声、より精度の高いリップシンク
セリフは口の動きにぴったり合い、環境音には左右の広がりがあります。
キーフレームとは、クリップ内の特定の時点に固定された静止画のことです。Kling 4.0がキーフレームから次のキーフレームまでの動きをアニメーション化するため、選んだフレームがショットの骨組みとなります。一般的な4点プランの例は次のとおりです:
開始フレーム
場所、光、メインの被写体を設定しましょう。これが視聴者の最初に目にする画像になります。
最初の変更
アクションが始まる瞬間を指定しましょう。キャラクターが立ち上がる、蓋が開く、車が発進する——そんな瞬間です。
転換点
リビールや新しいカメラアングルなど、ショットの向きが変わるフレームを固定しましょう。
最終フレーム
エンディングを固定すると、クリップはカットや延長の起点になる構図で終わります。
シンプルな動きなら、キーフレームは2つで十分です。追加するのは、思いどおりに見せたい瞬間だけにしましょう。キーフレームを増やすほど、その間でモデルが自由に生成できる余地は狭まります。
Omni Referenceなら、1つのタスクで複数種類の素材を同時に扱えます。種類ごとに個別の上限があり、それは合計15点という共通の枠内に収まります。
| 入力 | 最大 | 最適な用途 |
|---|---|---|
| 画像 | 10 | キャラクターのターンアラウンド、商品のアングル、ロケーション、絵コンテ、スタイルフレーム |
| 動画 | 5、合計30秒 | 従うべきモーション、振付、カメラワーク、テンポ |
| 被写体 | 7 | 全編を通して同じ見た目を保つ必要がある、繰り返し登場する人物・マスコット・商品 |
| 音声 | 対応 | 話しているキャラクターの声のトーンと音色 |
プロンプト内で各ファイルの役割を明示しましょう。例えば「画像2はジャケット、動画1はカメラワーク」のように指定します。役割を明示していない参照素材は、互いに競合してしまいます。
Flashは、同じモデル世代の軽量エディションです。長さ、解像度、キーフレームを犠牲にする代わりに、より素早い結果を実現します。
公開予定の完成作品向け
下書き・テスト・大量生成向け
実践的な進め方:まずFlashで複数のアイデアを素早く試し、採用する1つをフルモデルで作り直して、重要な箇所にキーフレームを追加します。
どちらも30秒のテイクを一度に生成できます。両者を分けるのは、指示の伝え方です。
| 比較 | Kling 4.0 | Seedance 3.0 |
|---|---|---|
| 1回の生成の最大長 | 30秒 | 30秒 |
| 主な操作方法 | タイムラインに固定されたキーフレーム | 参照スタックとテキストプロンプト |
| 参照容量 | 入力15点:画像10点、動画5点、被写体7点 | 入力50件:画像30件、動画10件、音声ファイル10件 |
| 入力としての音声 | 音声トーンのリファレンス | オーディオファイルは最大10個まで |
| 最も得意な分野 | 重要な瞬間の正確なタイミング、HDR出力 | 大規模なマルチモーダルブリーフ、カメラブロッキングを伴うシーン設計 |
決まったタイミングで特定の瞬間を登場させたいなら、Kling 4.0を選びましょう。画像やクリップ、音声を大量にまとめてモデルに学習させたいなら、Seedance 3.0を選びましょう。
長いプロンプトは、各部分の置き場所が決まっていればうまく機能します。この順序で書き、各部分は1〜2フレーズに収めましょう。
1. 件名
黄色いレインジャケットを着たサイクリスト
2. アクション
ブレーキをかけ、自転車を降りて見上げる
3. 設定
夕暮れの、濡れた石畳の通りで
4. カメラ
低い位置からのトラッキングショットが、クレーンの動きへと上昇するカット
5. ライト
水たまりに映るネオンサイン
6. タイミング
0~10秒:乗車、10~20秒:停止、20~30秒:見上げる
7. サウンド
雨音、タイヤの走行音、遠くの路面電車のベル
8. リファレンス
subject 1 はサイクリスト、image 3 は街路です
0–8秒:日差しが差し込む木製カウンターの上、陶器のカップから湯気が立ちのぼる。ゆっくりとプッシュイン。 8–16秒:バリスタの手がカップを前へ滑らせ、ピントがラテアートに移る。 16–24秒:窓際の席。女性が一口目を飲み、ほほえむ。 24–30秒:ゴールデンアワーのカフェを捉えたワイドショット。 音:グラインダーの駆動音、静かなアコースティックギター、ソーサーに置かれるカップの音。
日の出の棚田の上をドローンが滑空する。谷あいには霧がたなびき、農家がひとり、畦道を歩いている。カメラはゆっくりと降下し、最後は農家の横で目線の高さに収まる。音は鳥のさえずりと風のみ。音楽はなし。
夜のキッチン、暖かな実用照明の下。被写体1の年配の男性が問いかける:「もう終わったかい?」被写体2の10代の少女がスケッチブックを掲げて答える:「あと少し。」ミディアムのツーショット、わずかなハンドヘルドの動き、静かなステレオのルームトーン。
画像1はスニーカー、画像2はスタジオの背景です。スニーカーは光沢のあるターンテーブルの上で1回転し、その間、柔らかな光がメッシュをなぞります。カメラは最後、斜め前からのヒーローアングルで止まります。下層では柔らかな電子音のパルスが流れます。
タイムラインの延長とキーフレーム制御は、タイミングと一貫性が要件に含まれる制作でこそ真価を発揮します。
長さ、画質、コントロール、サウンド、そして Kling 4.0 が他の動画モデルとどう並ぶかについて、簡潔にお答えします。
これは、Kuaishouの生成ビデオチームであるKling AIがリリースした4番目の主要ビデオモデルです。テキスト、静止画像、短いクリップ、被写体参照を入力すると、音声付きの3~30秒のクリップを返し、タイムライン上に配置する最大10個のキーフレームに従います。
1回の生成で最大30秒、最短は3秒です。それより長くしたい場合は、完成したクリップを延長してください。延長を使えば、1つのシーンを約2分まで伸ばせます。
最大4K。1080pと4Kの出力はいずれも10ビットHDRに対応しているため、夕焼けや肌のトーンも、グレーディングで目に見える階調の段差が出ることはありません。より軽量なFlashエディションは720p・8ビットSDRまでです。
クリップ内の指定したタイミングに、最大10枚の静止画を配置できます。モデルはそれらを固定点として扱い、その間の動きを生成します。
始点から終点へのシンプルな動きならキーフレームは2つ。ある瞬間を狙い通りに見せたい箇所にだけ、追加してください。
合計で最大15件:
音声リファレンスは、話すキャラクターのトーン設定にも使用できます。
Flashは仕上がりよりもスピードを優先して調整されており、最大20秒・最大720pの8-bit SDRを生成できます。最初/最後のフレームやマルチキーフレームの入力には対応していません。30秒の長さ、キーフレーム、参照枠を最大限に使いたい場合、4KやHDRが必要な場合は、フルモデルに切り替えてください。
はい。映像とともに2チャンネルのステレオ音声を生成し、セリフや環境音、効果音も含まれます。リップシンクの精度は従来のKlingモデルより向上しています。
キャラクターは9言語で話すことができ、訛りや方言の違いも表現できます。また、モデルは画面上のテキストも9言語で描画でき、絵文字にも対応しています。
はい。編集モードでは、既存のクリップを最大5本・合計30秒まで取り込み、テキスト、画像、被写体の指示から、被写体や背景、表情、カメラアングル、セリフを変更できます。
はい。16:9、9:16、1:1に加えて、Kling 4.0ではシネマ風の構図に向けた21:9のウルトラワイドフレームが追加されています。
プロンプトは最大8,000トークンまで書くことができ、カメラワークのメモ、セリフ、サウンドキューを含むタイム付きスクリプトにも十分な長さです。長さよりも順序が重要です。被写体、アクション、設定、カメラ、ライト、タイミング、サウンドを、毎回同じ順番で並べましょう。
はい、15秒を超えるクリップ、ショット途中の瞬間のコントロール、HDR出力、21:9のフレームが必要な場合です。短い単一アクションのクリップであれば、Kling 3.0が依然として堅実な選択肢です。
正確なタイミングが重要なときは Kling 4.0 を選びましょう。キーフレームによって、いつ何が起きるかを確定できます。多数のリファレンスで結果をコントロールしたいときは Seedance 3.0 を。1つのタスクで画像・動画・音声ファイルを最大50点まで受け付けます。
人物を被写体リファレンスとして登録し、冒頭のキーフレームに登場させ、プロンプト内では一貫して同じラベルで参照します。1人につき参照は1つ。同じキャラクターでも異なる2枚の写真を使うと、結果が二つの方向に引っ張られます。