只要一段人物動作影片,加上一張靜態角色圖,Kling Motion Control 就能讓圖片中的角色重現影片裡的表演;目前支援單一人物,片段最長可達 30 秒。功能分為兩個版本:主打肢體動作的 Kling VIDEO 2.6,每秒 5–8 點數;著重臉部身分一致性的 Kling VIDEO 3.0,每秒 9–12 點數。Kling 官方指南指出,成品品質高度取決於輸入素材;一項 LinkedIn 實測也發現,角色圖與驅動影片在幾何結構上的對齊程度,是影響輸出品質最關鍵的因素。
Kling Motion Control 的運作原理
模型會從動作影片擷取動態資訊,再將動作套用到參考圖片中的角色,生成該角色完成相同動作的影片。依據 Kling 官方使用指南,系統一次僅支援一名角色;若動作參考或首幀畫面出現多個人,Kling 會自動選擇畫面中占比最大的對象。
兩項輸入都必須是單一且連續的鏡頭:不可剪接、不可切換景別,鏡頭移動也應盡量少。Kling 建議使用幅度明顯、速度適中、位移不大的動作。若動作太快或過於複雜,模型可能只能擷取其中一段有效的連續動作,成片就會短於原始上傳影片;此情況所扣除的點數明確不予退還。
輸入素材規格
| 項目 | 限制 |
|---|---|
| 動作影片長度 | 3–30 秒 |
| 最短可擷取連續動作 | 3 秒 |
| 圖片解析度(短邊) | 至少 340 px |
| 圖片解析度(長邊) | 最多 3,850 px |
| 圖片檔案大小 | 上限 10 MB |
| 影片檔案大小 | 上限 100 MB |
| 支援的圖片格式 | JPG、PNG、WEBP、GIF、AVIF |
| 支援的影片格式 | MP4、MOV、WEBM、M4V、GIF |
| 角色數量 | 一名(自動選取畫面最大主體) |
ComfyUI 文件則提出更嚴格的要求:圖片寬、高都至少要720 px,並建議角色圖完整呈現頭部、肩膀與軀幹。
角色朝向模式怎麼選
Kling 提供兩種朝向邏輯,決定輸出影片中的角色構圖與面向方式:
| 模式 | 動作依據 | 角色朝向依據 | 鏡頭運動 |
|---|---|---|---|
| Character Orientation Matches Video | 參考影片 | 參考影片 | 參考影片 |
| Character Orientation Matches Image | 參考影片 | 參考圖片 | 透過提示詞控制 |
在圖片朝向模式下,可用提示詞觸發五種鏡頭處理:Zoom In、Zoom Out、Camera Up、Camera Down 與 Fixed Position。ComfyUI 文件也指出,圖片朝向模式最長為10 秒,相較之下,影片朝向模式最長可達30 秒。
Kling 3.0 與 2.6 差在哪?功能、解析度與價格整理
Kling 對兩個版本的定位相當明確。2.6 是以肢體動作為核心的基礎版本,支援全身同步、複雜運動、手部動作、30 秒單鏡頭,以及透過文字提示詞控制場景。3.0 則進一步透過 Element Binding 強化臉部身分一致性。
Element Binding 可將一組臉部參考圖,或短片形式的臉部參考影片,綁定至角色上,讓模型在轉頭、表情變化與遮擋時更穩定地維持人物身分。Element Library 僅保存臉部資訊,不會記錄服裝、髮型、妝容或道具。Element Binding 僅適用於角色朝向跟隨影片朝向的模式。
版本功能對照
| 功能 | Kling 3.0 | Kling 2.6 |
|---|---|---|
| 核心優勢 | 跨角度與情緒變化時的臉部身分一致性 | 全身動作轉移 |
| Element Binding | 支援(多角度臉部參考) | 不支援 |
| 遮擋後還原 | 支援(宣稱高保真) | 不支援 |
| 鏡頭處理 | Multi-Elements、Curve Dolly、Camera Shake | Zoom In/Out、Camera Up/Down、Fixed |
| 解析度(Standard) | 720p | 720p |
| 解析度(Professional) | 1080p | 1080p |
| 來源影片長度範圍 | 3–30 秒(官方指南) | 3–30 秒(官方指南) |
價格
費用依生成影片的秒數計算,並按最接近的整秒數取整,詳見官方指南。
| 模型 | 模式 | 費率 |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 點數/秒 |
| Kling VIDEO 3.0 Motion Control | Professional | 12 點數/秒 |
| Kling VIDEO 2.6 Motion Control | Standard | 5 點數/秒 |
| Kling VIDEO 2.6 Motion Control | Professional | 8 點數/秒 |
3.4 秒的片段會向下取整為 3 秒,在 3.0 Standard 下需 27 點數;3.6 秒則向上取整為 4 秒,需 36 點數。若想了解訂閱方案價格與購買點數的費率,請參考我們的 Kling 3 API 價格指南。
實作流程:建立一支 Motion Control 影片
- 上傳動作影片。可從本機上傳,或從 Kling 內建的 Motion Library 選擇素材。影片必須是單人、單一連續鏡頭,長度介於 3–30 秒。
- 加入角色圖片。上傳要製作動畫的角色靜態圖,構圖必須對應動作類型:全身動作用全身圖,半身動作用半身圖。請確保四肢清楚可見,且人物周圍留有空間。
- 綁定臉部 Element(僅 3.0)。開啟「Bind Facial Element to Enhance Facial Consistency」,接著選取現有 Element,或上傳臉部圖片或短影片來建立新 Element。
- 設定朝向模式。完整編舞或全身動作選擇「Character Orientation Matches Video」;若是人像動畫,並希望用提示詞控制鏡頭移動,則選擇「Character Orientation Matches Image」。
- 撰寫場景提示詞(選填)。在圖片朝向模式中,提示詞可用於控制背景細節與鏡頭處理。
- 生成後逐項迭代。每次只調整一項變數,例如參考影片、角色圖片或綁定資料。若一次改動三者,出現瑕疵時就無法判斷問題源自哪項輸入。
Element Binding 要準備幾個角度?
若要讓 3.0 的 Element Binding 發揮效果,官方指南建議依據預期成果準備對應的臉部參考資料:
- 精準轉頭:一張正面照,加上左側和/或右側側臉照。
- 精準表情:一張中性正面照,以及一張帶有目標表情的正面照,例如微笑。
- 帶著笑容流暢 360° 旋轉:準備五張參考:正面、左側臉、右側臉、仰視與俯視,且全都維持笑容。
- 複雜情緒變化搭配頭部動作:準備正面照、微笑照、悲傷表情照及側臉照。
若要取得最豐富的臉部資料,Kling 建議上傳短影片而非靜態圖片,因為連續畫面能捕捉更多表情之間的過渡資訊。
透過 API 使用 Kling Motion Control
Kling 網頁 playground 按秒扣點,累積成本可能很快上升。Reddit 的 r/klingO1 中,有使用者測試 3.0 Motion Control 後認為動作「終於開始有『重量感』」,腳部也更像是踩穩地面,改善了 2.6 容易出現滑動感的問題(來源)。同一位使用者也提到,若是高產量工作,透過第三方供應商使用 Kling 3.0 Motion Control API,感覺比在 playground 消耗點數「明顯更便宜」;不過這只是單一使用者的個人觀察,並非量化的價格比較。
程式化存取主要有兩條路:適合視覺化工作流的 ComfyUI 整合,以及用於批次管線的直接 API 呼叫。
ComfyUI 整合
ComfyUI 文件提供官方合作節點,將所有 Motion Control 參數開放為工作流輸入:
- LoadImage node:角色參考圖片(JPG、PNG、WEBP、GIF、AVIF;上限 10 MB)
- LoadVideo node:動作參考影片(MP4、MOV、WEBM、M4V、GIF;上限 100 MB)
- character_orientation:
video或image - Prompt text:控制場景與背景
- Model tier:Standard(720p)或 Pro(1080p)
r/comfyui 的一則 Reddit 公告確認,ComfyUI-Kie-API node pack已加入 Kling 3.0 Motion Control 的實驗性支援,提供參考圖片、驅動影片、提示詞與朝向設定。
直接串接 API
若不透過 ComfyUI,也能藉由提供底層模型的 API 供應商呼叫 Kling Motion Control。核心請求內容包括模型版本識別碼、以 base64 或 URL 編碼的角色圖片、動作參考影片、朝向參數,以及選填的場景提示詞。生成採非同步方式:先提交工作、輪詢完成狀態,最後取得影片 URL。
若要使用現成的 Kling 3.0 Motion Control 端點,可試試 Kling Motion Control 模型頁面,其中提供 API 文件與即時價格。
單次生成要花多少點數?
| 情境 | 長度 | 模型/模式 | 成本 |
|---|---|---|---|
| 快速草稿測試 | 5 秒 | 2.6 Standard | 25 點數 |
| 重視臉部一致性的最終輸出 | 5 秒 | 3.0 Professional | 60 點數 |
| 30 秒單鏡頭 | 30 秒 | 2.6 Standard | 150 點數 |
| 批次生成 10 支片段(每支 5 秒) | 合計 50 秒 | 3.0 Standard | 450 點數 |
產量拉高後,成本差距會更明顯。相同為 50 秒輸出,10 支各 5 秒的 3.0 Professional 影片需要600 點數,2.6 Standard 則只要250 點數。建議草稿階段先用 2.6 Standard,只有在最終輸出確實重視臉部身分時,再使用 3.0 Professional。
不退款提醒:若參考影片的動作過快或過於複雜,導致模型只能擷取較短的有效片段,仍會依實際生成長度扣除點數。Kling 明確表示,此情況下點數不予退還。
想了解可降低測試成本的免費方案點數額度,請參考我們的 Kling AI 免費方案指南。
常見失敗狀況與修正方法
| 症狀 | 原因 | 解法 | 來源 |
|---|---|---|---|
| 動作過程中臉部漂移或變形 | 未使用 Element Binding,或只提供單一角度 | 重新綁定正面照及左/右側臉照;加入目標表情圖片 | 官方指南 |
| 輸出影片比參考影片短 | 動作太快或太複雜,無法擷取連續動態 | 改用速度較慢的片段;將關鍵動作放在 3–10 秒的區間內 | 官方指南 |
| 四肢模糊、糾結在一起 | 角色圖片中的身體部位遭裁切或遮擋 | 改用完整呈現全身、四肢分開且清楚可見的角色圖片 | 官方指南 |
| 手上出現圓環或瑕疵 | 負面提示詞效果缺失 | 簡化參考素材中的手勢,避免類似圓環的手部姿勢 | |
| 背景人物完全不動 | 模型只會動畫化主要角色 | 維持單人參考鏡頭 | |
| 人物身分不對或畫面扭曲 | 角色圖片品質不足或與動作不匹配 | 使用更清晰、光線良好、正面拍攝的圖片;構圖需對應動作類型 | |
| 動作像「在冰上滑行」 | 參考影片的腳步不穩定(2.6) | 穩定參考影片;據報 3.0 的腳部錨定效果更好 | |
| 扁平 2D 卡通難以處理背面視角 | 風格化比例較難追蹤 | 進行旋轉時,改用寫實或 3D 風格角色 | ComfyUI 文件 |
César Augusto Cabrera Boggio 在 LinkedIn 發表的實測指出,角色圖與驅動影片的鏡頭角度、方向及幾何結構必須高度一致,才能可靠追蹤動作。兩者不匹配,是臉部扭曲與動作抖動的主要成因。
FAQ
Kling Motion Control 可以同時使用多個角色嗎?
不行。每次生成僅支援一名角色。若參考影片或首幀中出現多人,Kling 會自動選取畫面占比最大的對象。多角色場景需先分別生成各角色片段,再於後製階段合成。
可以保留參考影片原本的音訊嗎?
Kling 官方指南未將音訊保留列為支援功能。生成影片是根據角色圖片及擷取出的動作資料重新渲染,建議在後製階段自行同步音訊。
Standard 與 Professional 模式有何不同?
Standard 模式輸出為720p,點數效率較佳,適合簡單動畫與快速測試。Professional 模式輸出為1080p,每秒成本更高,較適合細節豐富的編舞與手部動作較多的素材,依據 ComfyUI 的級別說明。依版本不同,Professional 每秒成本高出 33–60%:3.0 為 33%,2.6 為 60%。
能透過 API 或 ComfyUI 使用 Kling Motion Control 嗎?
可以。ComfyUI 合作節點將所有 Motion Control 參數整合為工作流。第三方 API 供應商也提供程式化存取,且至少有一位 Reddit 使用者表示,批次工作走 API 感覺更便宜;但這是個人評估,並非經驗證的價格比較。
Motion Control 影片最長可以做多久?
來源影片可為 3–30 秒,輸出原則上會對應來源長度。圖片朝向模式下,ComfyUI 文件將最大長度限制為 10 秒。最短可擷取的連續動作為 3 秒;若模型找不到 3 秒有效動作,生成就會失敗。
該選 Kling 2.6 還是 3.0?
| 情境 | 版本 | 模式 | 存取方式 |
|---|---|---|---|
| 快速測試或社群迷因 | 2.6 | Standard | Web playground |
| 短片、正面動作且需要維持人物身分 | 3.0 | Standard | Web playground |
| 全身舞蹈或編舞草稿 | 2.6 | Professional | Playground 或 API |
| 需多角度臉部一致性的最終輸出 | 3.0 | Professional | API(批次成本較省) |
| 批次生成(10 個以上變體) | 3.0 | Standard | API |
| 電影感環繞運鏡或手持鏡頭能量 | 3.0 | Standard + Curve Dolly / Camera Shake | Web playground |
若重點是大量肢體動作、低成本草稿,或簡單的正面動作,選2.6即可。當你在意臉部身分、表情、遮擋後還原,或需要 3.0 專屬鏡頭控制功能,如 Curve Dolly、Camera Shake、Multi-Elements,則應使用3.0。比起提示詞技巧,參考素材品質更決定成敗:使用穩定、單一主體、人物清楚可見、鏡頭連續且節奏適中的影片。