AIREITER

Kling Motion Control 完整指南:API、價格與工作流程(2026)

最近更新: 2026-08-13 01:29:16

Kling Motion Control 官方使用指南,顯示價格與版本資訊

只要一段人物動作影片,加上一張靜態角色圖,Kling Motion Control 就能讓圖片中的角色重現影片裡的表演;目前支援單一人物,片段最長可達 30 秒。功能分為兩個版本:主打肢體動作的 Kling VIDEO 2.6,每秒 5–8 點數;著重臉部身分一致性的 Kling VIDEO 3.0,每秒 9–12 點數。Kling 官方指南指出,成品品質高度取決於輸入素材;一項 LinkedIn 實測也發現,角色圖與驅動影片在幾何結構上的對齊程度,是影響輸出品質最關鍵的因素。

Kling Motion Control 的運作原理

模型會從動作影片擷取動態資訊,再將動作套用到參考圖片中的角色,生成該角色完成相同動作的影片。依據 Kling 官方使用指南,系統一次僅支援一名角色;若動作參考或首幀畫面出現多個人,Kling 會自動選擇畫面中占比最大的對象。

兩項輸入都必須是單一且連續的鏡頭:不可剪接、不可切換景別,鏡頭移動也應盡量少。Kling 建議使用幅度明顯、速度適中、位移不大的動作。若動作太快或過於複雜,模型可能只能擷取其中一段有效的連續動作,成片就會短於原始上傳影片;此情況所扣除的點數明確不予退還。

輸入素材規格

項目限制
動作影片長度3–30 秒
最短可擷取連續動作3 秒
圖片解析度(短邊)至少 340 px
圖片解析度(長邊)最多 3,850 px
圖片檔案大小上限 10 MB
影片檔案大小上限 100 MB
支援的圖片格式JPG、PNG、WEBP、GIF、AVIF
支援的影片格式MP4、MOV、WEBM、M4V、GIF
角色數量一名(自動選取畫面最大主體)

ComfyUI 文件則提出更嚴格的要求:圖片寬、高都至少要720 px,並建議角色圖完整呈現頭部、肩膀與軀幹。

角色朝向模式怎麼選

Kling 提供兩種朝向邏輯,決定輸出影片中的角色構圖與面向方式:

模式動作依據角色朝向依據鏡頭運動
Character Orientation Matches Video參考影片參考影片參考影片
Character Orientation Matches Image參考影片參考圖片透過提示詞控制

在圖片朝向模式下,可用提示詞觸發五種鏡頭處理:Zoom In、Zoom Out、Camera Up、Camera Down 與 Fixed Position。ComfyUI 文件也指出,圖片朝向模式最長為10 秒,相較之下,影片朝向模式最長可達30 秒。

Kling 3.0 與 2.6 差在哪?功能、解析度與價格整理

Kling 對兩個版本的定位相當明確。2.6 是以肢體動作為核心的基礎版本,支援全身同步、複雜運動、手部動作、30 秒單鏡頭,以及透過文字提示詞控制場景。3.0 則進一步透過 Element Binding 強化臉部身分一致性。

Element Binding 可將一組臉部參考圖,或短片形式的臉部參考影片,綁定至角色上,讓模型在轉頭、表情變化與遮擋時更穩定地維持人物身分。Element Library 僅保存臉部資訊,不會記錄服裝、髮型、妝容或道具。Element Binding 僅適用於角色朝向跟隨影片朝向的模式。

版本功能對照

功能Kling 3.0Kling 2.6
核心優勢跨角度與情緒變化時的臉部身分一致性全身動作轉移
Element Binding支援(多角度臉部參考)不支援
遮擋後還原支援(宣稱高保真)不支援
鏡頭處理Multi-Elements、Curve Dolly、Camera ShakeZoom In/Out、Camera Up/Down、Fixed
解析度(Standard)720p720p
解析度(Professional)1080p1080p
來源影片長度範圍3–30 秒(官方指南)3–30 秒(官方指南)

價格

費用依生成影片的秒數計算,並按最接近的整秒數取整,詳見官方指南。

模型模式費率
Kling VIDEO 3.0 Motion ControlStandard9 點數/秒
Kling VIDEO 3.0 Motion ControlProfessional12 點數/秒
Kling VIDEO 2.6 Motion ControlStandard5 點數/秒
Kling VIDEO 2.6 Motion ControlProfessional8 點數/秒

3.4 秒的片段會向下取整為 3 秒,在 3.0 Standard 下需 27 點數;3.6 秒則向上取整為 4 秒,需 36 點數。若想了解訂閱方案價格與購買點數的費率,請參考我們的 Kling 3 API 價格指南。

實作流程:建立一支 Motion Control 影片

  1. 上傳動作影片。可從本機上傳,或從 Kling 內建的 Motion Library 選擇素材。影片必須是單人、單一連續鏡頭,長度介於 3–30 秒。
  2. 加入角色圖片。上傳要製作動畫的角色靜態圖,構圖必須對應動作類型:全身動作用全身圖,半身動作用半身圖。請確保四肢清楚可見,且人物周圍留有空間。
  3. 綁定臉部 Element(僅 3.0)。開啟「Bind Facial Element to Enhance Facial Consistency」,接著選取現有 Element,或上傳臉部圖片或短影片來建立新 Element。
  4. 設定朝向模式。完整編舞或全身動作選擇「Character Orientation Matches Video」;若是人像動畫,並希望用提示詞控制鏡頭移動,則選擇「Character Orientation Matches Image」。
  5. 撰寫場景提示詞(選填)。在圖片朝向模式中,提示詞可用於控制背景細節與鏡頭處理。
  6. 生成後逐項迭代。每次只調整一項變數,例如參考影片、角色圖片或綁定資料。若一次改動三者,出現瑕疵時就無法判斷問題源自哪項輸入。

Element Binding 要準備幾個角度?

若要讓 3.0 的 Element Binding 發揮效果,官方指南建議依據預期成果準備對應的臉部參考資料:

  • 精準轉頭:一張正面照,加上左側和/或右側側臉照。
  • 精準表情:一張中性正面照,以及一張帶有目標表情的正面照,例如微笑。
  • 帶著笑容流暢 360° 旋轉:準備五張參考:正面、左側臉、右側臉、仰視與俯視,且全都維持笑容。
  • 複雜情緒變化搭配頭部動作:準備正面照、微笑照、悲傷表情照及側臉照。

若要取得最豐富的臉部資料,Kling 建議上傳短影片而非靜態圖片,因為連續畫面能捕捉更多表情之間的過渡資訊。

透過 API 使用 Kling Motion Control

Kling 網頁 playground 按秒扣點,累積成本可能很快上升。Reddit 的 r/klingO1 中,有使用者測試 3.0 Motion Control 後認為動作「終於開始有『重量感』」,腳部也更像是踩穩地面,改善了 2.6 容易出現滑動感的問題(來源)。同一位使用者也提到,若是高產量工作,透過第三方供應商使用 Kling 3.0 Motion Control API,感覺比在 playground 消耗點數「明顯更便宜」;不過這只是單一使用者的個人觀察,並非量化的價格比較。

程式化存取主要有兩條路:適合視覺化工作流的 ComfyUI 整合,以及用於批次管線的直接 API 呼叫。

ComfyUI 整合

ComfyUI 文件提供官方合作節點,將所有 Motion Control 參數開放為工作流輸入:

  • LoadImage node:角色參考圖片(JPG、PNG、WEBP、GIF、AVIF;上限 10 MB)
  • LoadVideo node:動作參考影片(MP4、MOV、WEBM、M4V、GIF;上限 100 MB)
  • character_orientation:video 或 image
  • Prompt text:控制場景與背景
  • Model tier:Standard(720p)或 Pro(1080p)

r/comfyui 的一則 Reddit 公告確認,ComfyUI-Kie-API node pack已加入 Kling 3.0 Motion Control 的實驗性支援,提供參考圖片、驅動影片、提示詞與朝向設定。

直接串接 API

若不透過 ComfyUI,也能藉由提供底層模型的 API 供應商呼叫 Kling Motion Control。核心請求內容包括模型版本識別碼、以 base64 或 URL 編碼的角色圖片、動作參考影片、朝向參數,以及選填的場景提示詞。生成採非同步方式:先提交工作、輪詢完成狀態,最後取得影片 URL。

若要使用現成的 Kling 3.0 Motion Control 端點,可試試 Kling Motion Control 模型頁面,其中提供 API 文件與即時價格。

單次生成要花多少點數?

情境長度模型/模式成本
快速草稿測試5 秒2.6 Standard25 點數
重視臉部一致性的最終輸出5 秒3.0 Professional60 點數
30 秒單鏡頭30 秒2.6 Standard150 點數
批次生成 10 支片段(每支 5 秒)合計 50 秒3.0 Standard450 點數

產量拉高後,成本差距會更明顯。相同為 50 秒輸出,10 支各 5 秒的 3.0 Professional 影片需要600 點數,2.6 Standard 則只要250 點數。建議草稿階段先用 2.6 Standard,只有在最終輸出確實重視臉部身分時,再使用 3.0 Professional。

不退款提醒:若參考影片的動作過快或過於複雜,導致模型只能擷取較短的有效片段,仍會依實際生成長度扣除點數。Kling 明確表示,此情況下點數不予退還。

想了解可降低測試成本的免費方案點數額度,請參考我們的 Kling AI 免費方案指南。

常見失敗狀況與修正方法

症狀原因解法來源
動作過程中臉部漂移或變形未使用 Element Binding,或只提供單一角度重新綁定正面照及左/右側臉照;加入目標表情圖片官方指南
輸出影片比參考影片短動作太快或太複雜,無法擷取連續動態改用速度較慢的片段;將關鍵動作放在 3–10 秒的區間內官方指南
四肢模糊、糾結在一起角色圖片中的身體部位遭裁切或遮擋改用完整呈現全身、四肢分開且清楚可見的角色圖片官方指南
手上出現圓環或瑕疵負面提示詞效果缺失簡化參考素材中的手勢,避免類似圓環的手部姿勢Reddit
背景人物完全不動模型只會動畫化主要角色維持單人參考鏡頭Reddit
人物身分不對或畫面扭曲角色圖片品質不足或與動作不匹配使用更清晰、光線良好、正面拍攝的圖片;構圖需對應動作類型LinkedIn
動作像「在冰上滑行」參考影片的腳步不穩定(2.6)穩定參考影片;據報 3.0 的腳部錨定效果更好Reddit
扁平 2D 卡通難以處理背面視角風格化比例較難追蹤進行旋轉時,改用寫實或 3D 風格角色ComfyUI 文件

César Augusto Cabrera Boggio 在 LinkedIn 發表的實測指出,角色圖與驅動影片的鏡頭角度、方向及幾何結構必須高度一致,才能可靠追蹤動作。兩者不匹配,是臉部扭曲與動作抖動的主要成因。

FAQ

Kling Motion Control 可以同時使用多個角色嗎?

不行。每次生成僅支援一名角色。若參考影片或首幀中出現多人,Kling 會自動選取畫面占比最大的對象。多角色場景需先分別生成各角色片段,再於後製階段合成。

可以保留參考影片原本的音訊嗎?

Kling 官方指南未將音訊保留列為支援功能。生成影片是根據角色圖片及擷取出的動作資料重新渲染,建議在後製階段自行同步音訊。

Standard 與 Professional 模式有何不同?

Standard 模式輸出為720p,點數效率較佳,適合簡單動畫與快速測試。Professional 模式輸出為1080p,每秒成本更高,較適合細節豐富的編舞與手部動作較多的素材,依據 ComfyUI 的級別說明。依版本不同,Professional 每秒成本高出 33–60%:3.0 為 33%,2.6 為 60%。

能透過 API 或 ComfyUI 使用 Kling Motion Control 嗎?

可以。ComfyUI 合作節點將所有 Motion Control 參數整合為工作流。第三方 API 供應商也提供程式化存取,且至少有一位 Reddit 使用者表示,批次工作走 API 感覺更便宜;但這是個人評估,並非經驗證的價格比較。

Motion Control 影片最長可以做多久?

來源影片可為 3–30 秒,輸出原則上會對應來源長度。圖片朝向模式下,ComfyUI 文件將最大長度限制為 10 秒。最短可擷取的連續動作為 3 秒;若模型找不到 3 秒有效動作,生成就會失敗。

該選 Kling 2.6 還是 3.0?

情境版本模式存取方式
快速測試或社群迷因2.6StandardWeb playground
短片、正面動作且需要維持人物身分3.0StandardWeb playground
全身舞蹈或編舞草稿2.6ProfessionalPlayground 或 API
需多角度臉部一致性的最終輸出3.0ProfessionalAPI(批次成本較省)
批次生成(10 個以上變體)3.0StandardAPI
電影感環繞運鏡或手持鏡頭能量3.0Standard + Curve Dolly / Camera ShakeWeb playground

若重點是大量肢體動作、低成本草稿,或簡單的正面動作,選2.6即可。當你在意臉部身分、表情、遮擋後還原,或需要 3.0 專屬鏡頭控制功能,如 Curve Dolly、Camera Shake、Multi-Elements,則應使用3.0。比起提示詞技巧,參考素材品質更決定成敗:使用穩定、單一主體、人物清楚可見、鏡頭連續且節奏適中的影片。