只需一段人物动作视频和一张静态角色图,Kling Motion Control 就能让图中的角色复现这段表演,单次最多生成 30 秒视频。该功能目前有两个版本:侧重身体动作的 Kling VIDEO 2.6,每秒消耗 5–8 积分;更重视面部身份一致性的 Kling VIDEO 3.0,每秒消耗 9–12 积分。Kling 官方指南明确指出,两者的效果都高度依赖输入素材;一项LinkedIn 实测也认为,角色图与驱动视频在构图和几何关系上的匹配度,是决定成片质量的首要因素。
Kling Motion Control 到底如何驱动角色
模型会从动作视频中提取运动信息,再将这些动作迁移到参考图片里的角色身上,最终生成角色完成同一动作的视频。根据Kling 官方用户指南,系统仅支持单个角色:如果动作参考或首帧中出现多人,Kling 会自动选择画面占比最大的那个人。
两项输入都应是连续的单镜头,不能有剪辑、切镜,镜头移动也应尽量少。Kling 建议使用幅度较大、速度适中、位移不要过大的动作。动作过快或过于复杂时,模型可能只能提取其中一段有效的连续动作,导致最终视频短于上传素材;这种情况下产生的积分明确不予退还。
输入素材规格
| 参数 | 限制 |
|---|---|
| 动作视频时长 | 3–30 秒 |
| 可提取的最短连续动作 | 3 秒 |
| 图片分辨率(短边) | 至少 340 px |
| 图片分辨率(长边) | 最多 3,850 px |
| 图片文件大小 | 最大 10 MB |
| 视频文件大小 | 最大 100 MB |
| 支持的图片格式 | JPG、PNG、WEBP、GIF、AVIF |
| 支持的视频格式 | MP4、MOV、WEBM、M4V、GIF |
| 角色数量 | 一个(自动选择画面主体) |
ComfyUI 文档给出了更严格的下限:图片宽度和高度均应至少达到 720 px,并建议角色图完整露出头部、肩膀和躯干。
两种角色朝向模式
Kling 提供两种朝向逻辑,决定角色在输出画面中如何跟随素材:
| 模式 | 动作跟随 | 朝向跟随 | 镜头运动 |
|---|---|---|---|
| 角色朝向与视频一致 | 参考视频 | 参考视频 | 参考视频 |
| 角色朝向与图片一致 | 参考视频 | 参考图片 | 通过提示词控制 |
在图片朝向模式下,提示词可触发五种镜头处理:Zoom In、Zoom Out、Camera Up、Camera Down 和 Fixed Position。ComfyUI 文档还指出,图片朝向模式最长仅支持 10 秒,而视频朝向模式最长可达 30 秒。
Kling 3.0 与 2.6:能力、分辨率和价格怎么选
Kling 对这两个版本的定位相当明确。2.6 是以身体动作迁移为核心的基础版本,支持全身同步、复杂运动动作、手部姿态、30 秒单镜头,以及通过文本提示词控制场景。3.0 则在此基础上加入 Element Binding,重点提升面部身份的一致性。
Element Binding 可以将一组面部参考图或短面部视频绑定到角色上,帮助模型在转头、表情变化和面部被遮挡时维持身份稳定。Element Library 仅保存面部信息,不会记录服装、发型、妆容或道具。需要注意的是,Element Binding 只在角色朝向与视频朝向一致时生效。
版本功能对照
| 功能 | Kling 3.0 | Kling 2.6 |
|---|---|---|
| 核心优势 | 跨角度、跨情绪的面部身份一致性 | 全身动作迁移 |
| Element Binding | 支持(多角度面部参考) | 不支持 |
| 遮挡后恢复 | 支持(宣称高保真) | 不支持 |
| 镜头处理 | Multi-Elements、Curve Dolly、Camera Shake | Zoom In/Out、Camera Up/Down、Fixed |
| 分辨率(Standard) | 720p | 720p |
| 分辨率(Professional) | 1080p | 1080p |
| 源视频时长范围 | 3–30 秒(官方指南) | 3–30 秒(官方指南) |
积分价格
根据官方指南,费用按最终生成时长以秒计费,并四舍五入到最接近的整数秒。
| 模型 | 模式 | 费率 |
|---|---|---|
| Kling VIDEO 3.0 Motion Control | Standard | 9 积分/秒 |
| Kling VIDEO 3.0 Motion Control | Professional | 12 积分/秒 |
| Kling VIDEO 2.6 Motion Control | Standard | 5 积分/秒 |
| Kling VIDEO 2.6 Motion Control | Professional | 8 积分/秒 |
生成 3.4 秒视频会向下取整为 3 秒,使用 3.0 Standard 时消耗 27 积分;3.6 秒则向上取整为 4 秒,消耗 36 积分。订阅档位价格和积分购买费率的详细说明,可参考我们的 Kling 3 API 定价指南。
实操流程:生成一条 Motion Control 视频
- 上传动作视频。可以从本地文件上传,也可以从 Kling 内置的 Motion Library 中选择。视频必须是单人连续镜头,时长为 3–30 秒。
- 添加角色图片。上传希望驱动的静态角色图。构图要与动作对应:全身动作搭配全身图,半身动作搭配半身图。确保四肢清晰可见,人物周围留有足够空间。
- 绑定面部元素(仅 3.0)。打开 “Bind Facial Element to Enhance Facial Consistency”,然后选择已有元素,或上传面部图片、短视频创建新元素。
- 设置朝向模式。全身舞蹈或编排动作选择 “Character Orientation Matches Video”;要在肖像动画中通过提示词控制镜头,则选择 “Character Orientation Matches Image”。
- 编写场景提示词(可选)。在图片朝向模式下,可用提示词控制背景细节和镜头处理方式。
- 生成后逐项迭代。每次只调整一个变量:动作视频、角色图片或绑定数据。三者同时更换,会很难判断究竟是哪项输入造成了问题。
Element Binding 怎么准备不同角度的素材
要让 3.0 的 Element Binding 发挥效果,官方指南建议按预期输出准备面部参考:
- 准确转头:准备一张正面照,再加左侧和/或右侧侧脸照。
- 准确表情:准备一张正面中性表情图,以及一张带有目标表情的正面图,例如微笑。
- 带微笑的自然 360° 旋转:准备五张参考图:正面、左侧脸、右侧脸、仰视、俯视,且全部保持微笑。
- 复杂情绪变化与头部运动:准备正面照、微笑照、悲伤表情照和侧脸照。
如果希望获得最丰富的面部数据,Kling 建议上传一段短视频而不是静态照片,因为连续画面比离散图片能记录更多表情过渡信息。
如何通过 API 使用 Kling Motion Control
Kling 网页端按秒扣除积分,使用频率一高,成本很容易累积。在 Reddit 的 r/klingO1 社区中,一位测试 3.0 Motion Control 的用户认为,动作“终于开始有了‘重量感’”,双脚也更像是固定在地面上,改善了 2.6 容易出现的滑行动画感(来源)。该用户还表示,大批量任务通过第三方提供商使用 Kling 3.0 Motion Control API,感觉比在网页端不断消耗积分“明显更便宜”。不过,这只是单个用户的个人体验,并非量化价格对比。
程序化接入主要有两条路径:一是用于可视化工作流的 ComfyUI 集成,二是适合批量管线的直接 API 调用。
ComfyUI 集成
ComfyUI 文档提供了官方合作节点,将 Motion Control 的所有参数开放为工作流输入:
- LoadImage 节点:角色参考图(JPG、PNG、WEBP、GIF、AVIF;最大 10 MB)
- LoadVideo 节点:动作参考视频(MP4、MOV、WEBM、M4V、GIF;最大 100 MB)
- character_orientation:
video或image - Prompt 文本:控制场景和背景
- 模型档位:Standard(720p)或 Pro(1080p)
r/comfyui 中的一则 Reddit 公告确认,ComfyUI-Kie-API node pack 已加入对 Kling 3.0 Motion Control 的实验性支持,可设置参考图、驱动视频、提示词和朝向选项。
直接调用 API
如果不使用 ComfyUI,也可以通过开放底层模型的 API 服务商调用 Kling Motion Control。核心请求通常包括模型版本标识、经 base64 编码或 URL 编码的角色图片、动作参考视频、朝向参数,以及可选的场景提示词。生成是异步进行的:先提交任务,再轮询任务状态,最后获取视频 URL。
如需可直接使用的 Kling 3.0 Motion Control 接口,可尝试 Kling Motion Control 模型页面,其中提供 API 文档和实时价格。
单次生成要花多少积分
| 场景 | 时长 | 模型 / 模式 | 成本 |
|---|---|---|---|
| 快速草稿测试 | 5 秒 | 2.6 Standard | 25 积分 |
| 需要面部一致性的最终成片 | 5 秒 | 3.0 Professional | 60 积分 |
| 30 秒单镜头 | 30 秒 | 2.6 Standard | 150 积分 |
| 批量生成 10 条视频(每条 5 秒) | 共 50 秒 | 3.0 Standard | 450 积分 |
生成量越大,成本差距越明显。同样输出 50 秒视频,10 条 5 秒的 3.0 Professional 视频需消耗 600 积分,而 2.6 Standard 只需 250 积分。建议草稿阶段先用 2.6 Standard,只有最终成片确实需要保持面部身份时,再使用 3.0 Professional。
不可退款提示:如果参考视频动作复杂或节奏过快,导致模型只能提取较短的有效动作片段,仍会按实际生成时长收费。Kling 明确表示,在这一情况下积分不予退还。
如需了解可抵扣测试成本的免费档积分额度,请查看我们的 Kling AI 免费档指南。
常见问题与排查方法
| 现象 | 可能原因 | 解决方法 | 来源 |
|---|---|---|---|
| 动作过程中面部漂移或变形 | 未使用 Element Binding,或只提供了一个角度 | 重新绑定正面照及左/右侧脸照,并加入目标表情图片 | 官方指南 |
| 输出时长短于参考视频 | 动作过快或过复杂,无法提取连续动作 | 换用节奏更慢的视频;将核心动作放在 3–10 秒区间内 | 官方指南 |
| 四肢模糊、粘连 | 角色图中的身体部位被裁切或遮挡 | 更换全身完整、四肢分开且清晰可见的角色图 | 官方指南 |
| 手上出现环状物或伪影 | 负面提示词失效 | 简化参考视频里的手部姿势,避免类似环形的手势 | |
| 背景人物静止不动 | 模型只驱动主角色 | 参考视频尽量使用单人镜头 | |
| 身份不对或面部扭曲 | 角色图片质量差,或与动作素材不匹配 | 使用更清晰、光线充足的正面图,并让构图匹配动作类型 | |
| 动作像“在冰上滑行” | 参考视频的脚步不稳定(2.6) | 稳定参考视频;据称 3.0 的脚部锚定效果更好 | |
| 扁平 2D 卡通难以处理背面视角 | 风格化比例更难追踪 | 旋转动作建议使用写实或 3D 风格角色 | ComfyUI 文档 |
César Augusto Cabrera Boggio 在LinkedIn 发布的一项实测发现,要获得可靠的动作追踪,输入角色图和驱动视频的镜头角度、方向与几何关系必须高度一致。不匹配是面部变形和动作抖动的主要原因。
FAQ
可以用 Kling Motion Control 同时驱动多个角色吗?
不可以。每次生成仅支持一个角色。如果参考视频或首帧中有多人,Kling 会自动选择画面占比最大的角色。多角色场景需要分别生成每个角色的视频,再在后期进行合成。
能保留参考视频的原始音频吗?
Kling 官方指南没有将音频保留列为支持功能。生成的视频是依据角色图和提取出的动作数据重新渲染的成片,音频建议在后期自行同步。
Standard 和 Professional 模式有什么区别?
Standard 模式输出 720p,积分效率更高,适合简单动画和快速测试。Professional 模式输出 1080p,每秒成本更高,更适合细节丰富的编舞和手部动作较多的内容(依据 ComfyUI 档位说明)。Professional 的每秒成本因版本不同高出 33–60%:3.0 高出 33%,2.6 高出 60%。
能通过 API 或 ComfyUI 使用 Kling Motion Control 吗?
可以。ComfyUI 合作节点已将全部 Motion Control 参数做成工作流输入。第三方 API 服务商也提供程序化访问;至少有一位 Reddit 用户表示,API 路线更适合批量任务且感觉更便宜,但这只是个人评价,并非经过验证的价格比较。
Motion Control 视频最长能生成多久?
源视频可为 3–30 秒,输出设计上会尽量匹配源视频时长。图片朝向模式下,ComfyUI 文档将最长时长限制为 10 秒。最短可提取的连续动作是 3 秒;如果模型找不到 3 秒有效动作,生成将会失败。
不同需求该选哪个版本
| 使用场景 | 版本 | 模式 | 接入方式 |
|---|---|---|---|
| 快速测试或社交媒体 meme | 2.6 | Standard | 网页端 playground |
| 短时长正面动作,同时保留身份特征 | 3.0 | Standard | 网页端 playground |
| 全身舞蹈或编舞草稿 | 2.6 | Professional | Playground 或 API |
| 要求多角度面部一致性的最终成片 | 3.0 | Professional | API(批量成本更低) |
| 批量生成(10 个以上变体) | 3.0 | Standard | API |
| 电影感环绕镜头或手持镜头动感 | 3.0 | Standard + Curve Dolly / Camera Shake | 网页端 playground |
如果重点是身体动作、低成本打样或简单正面动作,选 2.6。若面部身份、表情、遮挡恢复,或 3.0 专属镜头控制(Curve Dolly、Camera Shake、Multi-Elements)更重要,则选 3.0。相比提示词技巧,参考素材质量对结果影响更大:画面稳定、单一主体、人物清晰可见、连续拍摄且动作节奏适中,才是成功的基础。