AIREITER

AI 视频生成器提示词遵循度:6 款模型实测

最后更新: 2026-07-30 04:48:06

同是 Veo 3.1,某个公开排行榜给出的提示词遵循度是 7.8 分,另一个则是 9.2 分,但两者都没有公开测试提示词。于是我们在 2026-07-30 设计了两条提示词,拆成 20 个可以逐项验收的元素,交给六款模型生成。结果显示,模型之间的差距没有排行榜暗示得那么大;真正拉开差距的,不是品牌,而是指令类型。

哪款 AI 视频模型最听提示词

本次测试中,Seedance 2.0 Fast 遵循的指令最多:20 项可检查元素中命中 19 项,在难度更高的提示词中更是拿到干净的 10/10。Kling 3 Turbo 与 Veo 3.1 并列 18 分,Wan 2.7 为 17.5 分,Grok Imagine 为 16 分;Hailuo 02 Pro 以 15.5 分垫底,它直接漏掉了一整段事件序列。对难题提示词进行三次重复测试后,排名没有变化。Sora 2 则完全无法完成测试。

模型字面提示词压力提示词总分 /20单条成本每秒成本等待时间
Seedance 2.0 Fast9.010.019.0$0.83$0.165121–132 秒
Kling 3 Turbo9.58.518.0$0.45$0.09045–54 秒
Veo 3.19.09.018.0$1.25$0.15688–95 秒
Wan 2.79.08.517.5$0.40$0.080103–104 秒
Grok Imagine8.08.016.0$0.09$0.01543–49 秒
Hailuo 02 Pro9.06.515.5$0.29$0.049166–185 秒
Sora 2—————5 次提交失败

价格按照公开积分费率计算:Kling、Seedance、Wan、Hailuo 与 Grok 采用 Kie 的价格表,Veo 3.1 和 Sora 2 则采用 AIReiter 的模型页面价格。再按各模型实际返回的视频时长折算,具体数据见下表。

按你的镜头需求来选:

  • 提示词里有数量、顺序或“绝不移动”这类要求 → 选 Seedance 2.0 Fast。它是唯一把这十项全部做对的模型,这也是它更高价格所换来的东西。
  • 反复调整画面风格,而不是复杂动作序列 → 选 Kling 3 Turbo。遵循度几乎相当,价格约为一半,等待时间也只有约三分之一。
  • 只想先验证提示词是否能被读懂 → 选 Grok Imagine,每秒只要 $0.015。它的 16/20 主要是漏掉了一次入场。
  • 带明确先后关系的动作 → 不要选 Hailuo 02 Pro,它跳过了完整的一个事件。

2026-07-30 UTC 03:57 至 03:59 期间,Sora 2 在两条提示词和三次间隔重试中的全部五次提交,都返回 UPSTREAM_BUSY / Upstream service is busy or upgrading。没有扣费、没有视频,因此也没有评分。

测试方法:两条提示词,20 项可验收元素

两条提示词中的每个分句,都对应画面中可直接确认的内容。我们没有使用“电影感”“8K”或“氛围感”这类无法评分的词。每条提示词包含十项元素,分别标记为 ✓(1 分)、~(部分满足,0.5 分)或 ✗(0 分)。这里不评画面质量,也不评时序稳定性:一段视频可以很漂亮、很稳定,却悄悄漏掉你一半的要求。Grok Imagine 的输出更像 3D 渲染而非摄影画面,但这不会影响它的分数。

字面提示词考察模型能否搭建一个被描述出来的场景。十项元素就是提示词中点名的十件事:一辆红色复古自行车、靠在黄色砖墙上;一只只有一只黑耳朵的白猫;从画面右侧进入;停在前轮旁并向上看;招牌写着 OPEN 7AM;镜头从广角缓慢移动至中景;机位贴近地面;阴天光线且没有太阳;画面中没有其他人。

A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.

压力提示词则考察数量、事件顺序和否定指令。十项元素分别为:恰好三只鸭子;三只大小始终一致;排在木桌上;没有手或人;中间的鸭子先倒下;左边的鸭子随后倒下;右边的鸭子绝不移动;镜头固定;纯白背景;来自正上方的硬光。

Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.

模型看到提示词前,可能已经被改写过

其中两款模型默认启用了提示词改写器:Wan 2.7 的 prompt_extend,以及 Hailuo 02 Pro 的 prompt_optimizer。文档都注明其默认值为 true。如果你直接提交提示词而不调整开关,最终评分的就不是你写下的原文。本测试中,两者均设为 false;若保持默认开启,测到的会同时包括改写器和模型本身。

还有些参数根本不会被严格遵守。所有视频都请求为 5 秒、720p、16:9,但有三款模型自行覆盖了这些设置。因此,上文的每秒价格按照实际返回结果计算,而不是按请求值:

模型发送设置实际返回扣除积分
Seedance 2.0 Fast5 秒,720p,16:95.0 秒,1280×720165(33/秒)
Kling 3 Turbo5 秒,720p,16:95.0 秒,1280×72090(18/秒)
Veo 3.15 秒,16:98.0 秒,1280×720每次 125
Wan 2.75 秒,720p,16:95.0 秒,1280×72080(16/秒)
Grok Imagine6 秒(最低值),720p,16:96.0 秒,1280×72018(3/秒)
Hailuo 02 Pro5 秒,720p,16:95.9 秒,1920×108057

Hailuo 02 Pro 的文档只列出提示词和两个开关作为输入项,因此没有其他参数可设;它两次都返回了 1080p。无论发送什么设置,Veo 3.1 都返回 8 秒;而 Grok Imagine 的文档注明最低时长为 6 秒。

六款模型都做对了什么

粗粒度的构图并不是这六款模型的失分点。所有模型都生成了一辆靠在黄色砖墙上的红色复古自行车,也都把画面文字“OPEN 7AM”准确写出,没有出现任何错字。两条否定指令同样全部被遵守:六段街景视频中均未出现人物,六段固定机位的小鸭视频中也都没有镜头移动。

六款 AI 视频模型使用相同自行车与猫提示词生成的画面,截取自每段视频 68% 位置

模型容易在哪些指令上失手:四种典型情况

数量与属性细节

“一只只有一只黑耳朵的白猫”这项要求,六款模型中只有一款完全做到。Hailuo 02 Pro 生成的猫,确实是其他部位为白色、仅有一只耳朵为黑色。Kling 3 Turbo 和 Veo 3.1 做出了黑耳朵,却又加了一条黑尾巴;Wan 2.7 将黑色斑块扩散到两只耳朵;Grok Imagine 画出了完整的暹罗猫面罩;Seedance 2.0 Fast 则给几乎纯白的猫在一侧耳尖留下了淡淡的深色痕迹。

六款模型生成的猫头部细节,展示各自如何处理一只黑耳朵的要求

所有模型都理解了“带黑色标记的白猫”,但除了 Hailuo,没有一款把“一个”当作明确的数量。在这六组输出里,属性数量的可靠性明显低于粗粒度构图。

事件顺序与时间安排

小鸭提示词要求严格的动作顺序:中间倒下,然后左边倒下,右边永远不动。四款模型正确完成了这个顺序:Kling 3 Turbo 分别在 2.0 秒和 4.9 秒倒下;Seedance 2.0 Fast 为 2.0 秒和 3.5 秒;Wan 2.7 为 1.0 秒和 4.0 秒;Veo 3.1 为 1.6 秒和 4.8 秒。没有一款精确实现要求的两秒间隔,但六段视频中的右侧小鸭都保持不动。

Hailuo 02 Pro 则完全没有完成这一段。中间的小鸭从未倒下,反而是左侧小鸭转成侧面视角,体积膨胀到接近原来的两倍,而三只鸭子始终都立着。

六款模型的小鸭动作顺序测试,对比起始、中段和最后一帧

Grok Imagine 的倒下顺序是对的,但小鸭是向前栽到嘴上,而不是侧倒。Veo 3.1 也做对了顺序,却让两只已倒下的小鸭在最后一帧前重新站了起来:事件发生了,状态却没能保持。

镜头控制力

所有模型都遵守了固定机位,但对指定镜头运动的执行并不可靠。Wan 2.7 和 Veo 3.1 都先按照要求,从广角推进到中景,之后却继续推向极近特写;Wan 最后只剩一个裸露的轮圈,猫完全出画。Grok Imagine 的运动幅度小到几乎无法察觉。Hailuo 02 Pro 是唯一违背“保持贴地机位”的模型,它大约从臀部高度拍摄,另外五款则都维持了低机位。

物体一致性

物体一动,尺寸就容易变化。Hailuo 的左侧小鸭长大到接近初始尺寸的两倍;Grok Imagine 中两只倒下的小鸭都明显变大;Kling 3 Turbo 与 Veo 3.1 中倒下的小鸭也有轻微增大。只有 Seedance 2.0 Fast 和 Wan 2.7 从第一帧到最后一帧都让三只小鸭维持相同大小。

尺寸一致性往往没有被写进提示词,也因此经常没人注意到。

各模型在字面提示词和压力提示词中,十项元素的遵循数量

六款模型中有五款在静态场景上集中于 8.0–9.5 分,真正的差异出现在数量和有先后关系的事件上,Hailuo 在这里低了 2.5 分。简单镜头下,选模型的收益不大;提示词里一旦出现数字,差异就会迅速放大。

重复测试后,排名还能成立吗?

对于我们重复测试的三款模型,答案是可以。每款都针对压力提示词额外生成两次,并按相同规则评分,最终分数区间没有重叠。

模型第 1 次第 2 次第 3 次中位数范围
Seedance 2.0 Fast10.09.510.010.09.5–10.0
Kling 3 Turbo8.58.08.08.08.0–8.5
Hailuo 02 Pro6.56.5—6.5n=2

Kling 3 Turbo 在三次测试中都把要求的纯白背景画成蓝灰色墙面,这更像是稳定偏好,而非随机采样噪声。Hailuo 02 Pro 两次都复现了完全相同的失败:中间小鸭不倒,左侧小鸭膨胀到接近两倍。Hailuo 的第三次测试因每日积分上限而被拦截,所以其分数中位数只基于两个样本。

Seedance、Kling 和 Hailuo 对压力提示词的重复测试结果

重复测试还暴露了一种单次生成看不出来的新行为。Kling 3 Turbo 在第 2 次中让中间小鸭倒下后,又在最后一帧前重新站起;这与 Veo 3.1 在唯一一次测试中出现的状态回退一致。事件可以触发,状态却未必能持续。

模型不听话时,重试到底要花多少钱

价格与速度并不成正比。Hailuo 02 Pro 是单条成本第二低的模型,却以 166–185 秒成为最慢的一款;Kling 3 Turbo 则在 45–54 秒内交出 18/20 的成绩。单条价格也会让短视频模型看起来更便宜:Veo 3.1 单条 $1.25,Seedance 2.0 Fast 为 $0.83,但 Veo 返回 8 秒、Seedance 返回 5 秒,折算后两者的每秒价格几乎相同,分别是 $0.156 和 $0.165。

Kie 价格表显示 Seedance 2.0 Fast 每秒为 33 积分

本文背后的 17 段视频共花费 1,387 Kie 积分和 250 AIReiter 积分。按每美元分别对应 200 积分和 100 积分计算,共计 $9.44;Sora 2 的五次失败提交没有收费。生成本身不贵,贵的是因为第四项元素丢了、又没有检查清单发现,于是不得不连续生成三次。

正如 一位 r/SoraAi 用户所说:“无论我把提示词写得多清晰、多详细、多严格,SORA 都会稳定地无视基础的视觉指令。”逐元素评分能把这种抱怨转化为明确的指令清单,而这才是可以据此采取行动的信息。

拿你的镜头清单自己测一次

  1. 把一条真实提示词改写成每个分句都能验收的形式——用镜头高度、光线方向和运镜终点画面,替代“电影感”之类的表述。
  2. 生成前先拆成带编号的元素清单。十项就足够;务必写下来,否则你只能凭记忆评分,通常会不自觉地给高分。
  3. 关闭改写器。在 Wan 中将 prompt_extend 设为 false,在 Hailuo 中将 prompt_optimizer 设为 false;比较之前,也要确认你的平台是否有自己的改写器。
  4. 以相同的视频时长和分辨率,将完全一致的字符串发送给两到三款模型,并记录各自静默覆盖了哪些参数。
  5. 完整观看视频,并以首帧、中间帧和最后一帧作为检查点——短暂的状态错误可能发生在采样帧之间。之后只重跑那些漏掉你真正关心元素的模型。少一只黑耳朵未必重要;倒下的小鸭重新站起来就很重要。

如果想直接复现我们的测试,Veo 3.1、Seedance 2 Fast 和 Sora 2 的模型页面列出了上文使用的精确模型 ID 及每秒积分价格。

常见问题

哪款 AI 视频生成器最准确?

在本次测试中是 Seedance 2.0 Fast:20 项可检查元素中命中 19 项,也是唯一在数量、顺序和否定指令上全部过关的模型。但在简单场景中,六款里有五款的准确性几乎没有差别;真正区分排名的是带顺序的提示词。

Seedance 比 Veo 3.1 或 Sora 2 更好吗?

Seedance 2.0 Fast 比 Veo 3.1 高出 1 分,分别为 19 分与 18 分,单条价格则是后者的三分之二;两者都正确完成了小鸭动作序列。我们无法给 Sora 2 排名:它在 2026-07-30 的五次提交都因上游失败,没有分数,而不是得分低。

Kling 3 Turbo 值得用于提示词要求多的工作吗?

如果速度比动作序列更重要,值得。Kling 3 Turbo 在六款模型中取得最高的字面提示词分数,为 9.5/10,返回时间仅 45–54 秒;但在压力提示词中,它因把要求的纯白背景做成蓝灰色墙面而失去 1 分。

提示词更长会提高遵循度吗?

不一定。本测试中的字面提示词比压力提示词更长,但每款模型在前者的得分都更高,因为它描述的是静态布局,而非数量和事件顺序。

这项测试回答不了的问题

三次测试足以表明这些分数并非采样噪声,但还不足以构成基准测试。只有 Seedance、Kling 和 Hailuo 进行了重复测试;Veo 3.1、Wan 2.7 和 Grok Imagine 仍各自只有一次结果。两条提示词也都是单镜头、无对白、时长不足十秒,这意味着最可能在真实剪辑中出问题的指令类型——多镜头连续性、台词、同一命名角色再次出现——完全没有纳入测试。上面的排名只告诉你,谁更能遵循一个被描述的镜头。它能否撑住整份镜头清单,是下一项测试,而且是另一回事。

延伸阅读: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · AI 运镜提示词实测