AI動画モデルの「プロンプト追従性」をうたうスコアは、比較してみると判断材料として使いにくい。たとえばVeo 3.1は、ある公開リーダーボードで7.8点、別のリーダーボードでは9.2点とされているものの、どちらも評価に使ったプロンプトを公開していない。そこで2026-07-30に、個別に確認できる要素を20個含む2種類のプロンプトを作り、6モデルで検証した。結果は、リーダーボードの数字から受ける印象ほど大きくは開かなかった。差が出たのはブランド名ではなく、指示の種類だった。
プロンプトに最も忠実だったAI動画モデル
今回もっとも多くの指示を守ったのはSeedance 2.0 Fastで、20要素中19をクリアした。より難しいプロンプトでは10/10の満点だった。Kling 3 TurboとVeo 3.1は18点で同点、Wan 2.7は17.5点、Grok Imagineは16点、Hailuo 02 Proは一連のイベントを丸ごと無視して15.5点となった。難問プロンプトについて3回の再試行も行ったが、この順位は変わらなかった。Sora 2はテスト自体ができなかった。
| モデル | 記述シーン | 負荷テスト | 合計 /20 | 1クリップあたりの料金 | 1秒あたり | 待ち時間 |
|---|---|---|---|---|---|---|
| Seedance 2.0 Fast | 9.0 | 10.0 | 19.0 | $0.83 | $0.165 | 121–132秒 |
| Kling 3 Turbo | 9.5 | 8.5 | 18.0 | $0.45 | $0.090 | 45–54秒 |
| Veo 3.1 | 9.0 | 9.0 | 18.0 | $1.25 | $0.156 | 88–95秒 |
| Wan 2.7 | 9.0 | 8.5 | 17.5 | $0.40 | $0.080 | 103–104秒 |
| Grok Imagine | 8.0 | 8.0 | 16.0 | $0.09 | $0.015 | 43–49秒 |
| Hailuo 02 Pro | 9.0 | 6.5 | 15.5 | $0.29 | $0.049 | 166–185秒 |
| Sora 2 | — | — | — | — | — | 送信5回失敗 |
料金は公開されているクレジット単価を基に算出した。Kling、Seedance、Wan、Hailuo、GrokはKieの料金表、Veo 3.1とSora 2はAIReiterのモデルページ(Veo 3.1、Sora 2)を参照し、各モデルが実際に返したクリップの長さで割っている。各モデルの返却仕様は以下の表にまとめた。
ショットの要件に合わせて選ぶなら、次のようになる。
- 数、順番、「絶対に動かない」を指定する場合 → Seedance 2.0 Fast。こうした10要素をすべて正しく処理した唯一のモデルであり、価格プレミアムの理由はここにある。
- 動作順より見た目を詰めたい場合 → Kling 3 Turbo。追従性はほぼ同等で、価格はおよそ半分、待ち時間は約3分の1だった。
- まずプロンプトが通じるか確認したい場合 → 1秒あたり$0.015のGrok Imagine。16/20の主な失点は、1つの登場動作が欠けたことだった。
- 順序のあるアクションを作る場合 → Hailuo 02 Proは避けたい。イベントを1つ丸ごと飛ばした。
Sora 2では、2026-07-30の03:57から03:59 UTCに両プロンプトと間隔を空けた3回の再試行を含む5回の送信を行ったが、すべてUPSTREAM_BUSY / Upstream service is busy or upgradingが返った。課金はなく、クリップもスコアもない。
テスト方法:2プロンプト・検証可能な20要素
2つのプロンプトは、すべての節がフレーム内で確認できる要素に対応するよう作った。「cinematic」「8k」「moody」のように採点できない語は使っていない。各プロンプト10要素を、✓(1点)、~(一部達成、0.5点)、✗(0点)で評価した。画像品質や時間的一貫性はこの評価に含めていない。見栄えがよく安定した動画でも、指示の半分をひそかに落としていることはある。Grok Imagineの出力は写真というより3Dレンダーに見えるが、その点での減点はしていない。
記述シーン用のプロンプトでは、モデルが指定された場面を組み立てられるかを確認する。評価した10要素は、赤いヴィンテージ自転車が1台、黄色いレンガ壁にもたれていること、片耳だけが黒い白猫、猫が画面右から入ること、前輪のそばで止まって見上げること、「OPEN 7AM」と書かれた看板、ワイドからミディアムへのドリー、地面の高さに維持されたカメラ、太陽のない曇天光、人物が映らないことだ。
A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.
負荷テスト用プロンプトでは、数の指定、イベント順、否定指示を試した。10要素は、黄色いアヒルが正確に3羽、3羽が同じ大きさを保つこと、木製テーブルの上に横一列であること、手や人物が出ないこと、中央のアヒルが最初に倒れること、その後に左が倒れること、右は絶対に動かないこと、固定カメラ、真っ白な背景、真上からの硬い光だ。
Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.
モデルに渡る前にプロンプトを書き換える設定
このうち2モデルは、プロンプトを書き換える機能がデフォルトで有効になっている。Wan 2.7のprompt_extendと、Hailuo 02 Proのprompt_optimizerだ。どちらもドキュメント上では初期値がtrueとなっている。設定に触れずに送信すれば、採点対象となるのは自分が書いた文ではない。今回は両方をfalseに設定した。デフォルトのままなら、テストはモデルだけでなくリライターも測ることになる。
そもそも指定が反映されないパラメータもある。全クリップは5秒、720p、16:9でリクエストしたが、3モデルはこれを上書きした。上の1秒あたりの料金はリクエスト値ではなく、実際の返却内容を基にしている。
| モデル | 送信値 | 返却値 | 請求クレジット |
|---|---|---|---|
| Seedance 2.0 Fast | 5秒、720p、16:9 | 5.0秒、1280×720 | 165(33/秒) |
| Kling 3 Turbo | 5秒、720p、16:9 | 5.0秒、1280×720 | 90(18/秒) |
| Veo 3.1 | 5秒、16:9 | 8.0秒、1280×720 | 呼び出しごとに125 |
| Wan 2.7 | 5秒、720p、16:9 | 5.0秒、1280×720 | 80(16/秒) |
| Grok Imagine | 6秒(下限)、720p、16:9 | 6.0秒、1280×720 | 18(3/秒) |
| Hailuo 02 Pro | 5秒、720p、16:9 | 5.9秒、1920×1080 | 57 |
Hailuo 02 Proでドキュメント化されている入力はプロンプトと2つのスイッチだけで、解像度などを設定する項目はない。2回とも1080pで返ってきた。Veo 3.1は送信値にかかわらず8秒を返し、Grok Imagineは6秒が下限と明記している。
6モデルすべてが守れた指示
大まかな構図は、今回の6モデルの弱点ではなかった。6モデルすべてが、黄色いレンガ壁に寄りかかる赤いヴィンテージ自転車を1台だけ配置し、画面内テキストの「OPEN 7AM」も1文字も間違えずに描画した。また、否定指示もすべて守った。6本の街角クリップには人物が現れず、6本のアヒルクリップではカメラが動かなかった。
指示が崩れる4つのポイント
数の指定と属性の細部
「片耳だけが黒い白猫」を正確に再現できたのは、6モデル中1つだけだった。Hailuo 02 Proだけが、白い体に黒い耳が1つだけある猫を出力した。Kling 3 TurboとVeo 3.1は黒い耳を再現した一方で黒い尻尾も追加した。Wan 2.7は両耳に黒い斑点を広げ、Grok Imagineは顔全体をシャム猫のようなマスク柄にし、Seedance 2.0 Fastはほぼ完全な白猫に耳先の淡い暗色のにじみを加えた。
どのモデルも「黒い模様のある白猫」までは理解していた。しかし、「1つ」を数として扱えたのはHailuoだけだった。この6出力では、属性の数に関する指示は、大まかな構図より明らかに信頼性が低い。
イベントの順番とタイミング
アヒルのプロンプトは、中央が倒れ、次に左が倒れ、右は動かないという順序を指定した。4モデルはこの順番を正しく実行した。Kling 3 Turboは2.0秒と4.9秒、Seedance 2.0 Fastは2.0秒と3.5秒、Wan 2.7は1.0秒と4.0秒、Veo 3.1は1.6秒と4.8秒だった。指定した約2秒の間隔を正確に満たしたモデルはなかったが、右側のアヒルは6クリップすべてで動かなかった。
Hailuo 02 Proは、そもそもこの動作を実行しなかった。中央のアヒルは倒れず、代わりに左のアヒルが横向きに回転して、3羽とも立ったままほぼ2倍の大きさに膨らんだ。
Grok Imagineはアヒルを正しい順番で倒したが、横倒しではなく、くちばしを下にして前へ倒した。Veo 3.1は順番を守った後、最終フレームまでに倒れた2羽を再び立ち上がらせた。イベントは起きたが、その状態を維持できなかった。
カメラ指示への忠実さ
固定カメラの指定はすべて守られた一方、指定したカメラ移動はそうではなかった。Wan 2.7とVeo 3.1は、要求したワイドからミディアムへのドリーを始めたものの、そのまま極端なクローズアップまで寄っていった。Wanの最終フレームでは、猫が完全にフレーム外へ消え、むき出しの車輪リムだけが残った。Grok Imagineは移動量が小さく、寄りはほとんど見分けられない。Hailuo 02 Proは「地面の高さを維持」という指示を破った唯一のモデルで、他の5モデルが低い位置にカメラを置いたのに対し、おおよそ腰の高さから撮影していた。
オブジェクトの大きさの一貫性
動くと物体の大きさが変わる。Hailuoの左のアヒルは開始時のほぼ2倍まで大きくなり、Grok Imagineの倒れた2羽も目に見えて拡大した。Kling 3 TurboとVeo 3.1でも、倒れたアヒルはわずかに大きくなった。最初から最後まで3羽を同じ大きさに保ったのは、Seedance 2.0 FastとWan 2.7だけだった。
サイズの一貫性は、明示しなければ守られず、気付かなければ見過ごされる。
静的なシーンでは、6モデル中5つが8.0〜9.5点に集中した。差が広がるのは数の指定と順序のあるイベントで、Hailuoはそこで2.5点落とした。単純なショットならモデル選びの差は小さい。しかしプロンプトに数が入った瞬間、その差は大きくなる。
再試行しても順位は変わるか
再試行した3モデルについては、変わらなかった。それぞれ負荷テスト用プロンプトをさらに2回実行し、同じ基準で採点したところ、スコア範囲は重ならなかった。
| モデル | 実行1 | 実行2 | 実行3 | 中央値 | 範囲 |
|---|---|---|---|---|---|
| Seedance 2.0 Fast | 10.0 | 9.5 | 10.0 | 10.0 | 9.5–10.0 |
| Kling 3 Turbo | 8.5 | 8.0 | 8.0 | 8.0 | 8.0–8.5 |
| Hailuo 02 Pro | 6.5 | 6.5 | — | 6.5 | n=2 |
Kling 3 Turboは3回すべてで、指定した真っ白な背景ではなく青灰色の壁を描いた。これはサンプリングの偶然ではなく、安定した傾向といえる。Hailuo 02 Proも2回ともまったく同じ失敗を再現した。中央のアヒルは倒れず、左のアヒルはほぼ2倍に膨らんだ。Hailuoの3回目は1日のクレジット上限に阻まれたため、中央値は2サンプルに基づく。
再試行では、1回だけのテストでは見えなかった挙動も見つかった。Kling 3 Turboの中央のアヒルは実行2で倒れた後、最終フレーム前に再び立ち上がった。これはVeo 3.1が唯一の実行で見せた状態の巻き戻りと同じだ。イベントは発生しても、状態が維持されるとは限らない。
指示を無視されたとき、再生成にいくらかかるか
料金と速度は連動しない。Hailuo 02 Proは1クリップあたりでは2番目に安価だったが、166〜185秒で圧倒的に遅かった。一方、Kling 3 Turboは18/20を45〜54秒で返した。1クリップあたりの価格だけでは、短尺モデルが有利に見える。Veo 3.1はSeedance 2.0 Fastの$0.83に対して$1.25だが、Veoは8秒、Seedanceは5秒を返す。そのため1秒あたりでは$0.156と$0.165で、両者はほぼ同額になる。
この記事のために生成した17クリップは、Kieで1,387クレジット、AIReiterで250クレジットを消費した。1ドルあたり200クレジットと100クレジットで換算すると、合計$9.44になる。失敗したSora 2の5回の送信には料金がかからなかった。生成自体は安い。しかし4番目の要素が抜け、チェックリストもそれを見落とし、3回生成することになれば話は別だ。
r/SoraAiのある投稿者はこう表現している。"No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." 要素単位で採点すれば、これを「どの指示が無視されたか」の一覧に変えられる。そこからなら対処できる。
自分のショットリストで試す方法
- 実際に使うプロンプトを1つ選び、すべての節を検証可能な内容に書き換える。「cinematic」の代わりに、カメラの高さ、光の方向、移動が終わるフレームを指定する。
- 生成前に、プロンプトを番号付きの要素リストへ分解する。10要素で十分だ。書き出さないと記憶頼みで評価することになり、甘く採点してしまう。
- リライターを無効にする。Wanでは
prompt_extendをfalseに、Hailuoではprompt_optimizerをfalseに設定する。比較する前に、使うプラットフォームにも同種の機能がないか確認したい。 - 同一の文字列を、再生時間と解像度を揃えて2〜3モデルへ送信する。そして各モデルが何を黙って上書きしたかを記録する。
- クリップ全体を確認し、開始・中盤・最終フレームをチェックポイントにする。一時的な状態崩れは、サンプルしたフレームの間で起こる。その後、自分にとって重要な要素を落としたモデルだけを再試行する。黒い耳がないことは問題でなくても、倒れたアヒルが立ち上がることは問題になる。
今回の実行を直接再現したい場合は、Veo 3.1、Seedance 2 Fast、Sora 2のモデルページに、上で使用した正確なモデルIDと1秒あたりのクレジット単価が記載されている。
FAQ
もっとも正確なAI動画ジェネレーターは?
今回のテストではSeedance 2.0 Fastだった。検証可能な20要素中19を守り、数、順序、否定指示をすべて通した唯一のモデルでもある。ただし、単純なシーンでは6モデル中5つの精度はほぼ同じだった。順位の差が出るのは、順序を含むプロンプトである。
SeedanceはVeo 3.1やSora 2より優れている?
Seedance 2.0 FastはVeo 3.1を19対18で1点上回り、1クリップあたりの価格は3分の2だった。両モデルともアヒルの順序は正しく実行した。Sora 2は順位付けできない。2026-07-30の5回の送信はすべてアップストリームで失敗しており、低スコアなのではなく、そもそもスコアがない。
プロンプトが複雑な用途でKling 3 Turboを選ぶ価値はある?
順序制御より速度を優先するなら、ある。Kling 3 Turboは記述シーン用プロンプトで6モデル中最高の9.5/10を取り、45〜54秒で返した。ただし負荷テストでは、指定が真っ白な背景だったにもかかわらず青灰色の壁を描き、1点を失った。
プロンプトを長くすると追従性は上がる?
長いだけでは上がらない。今回の記述シーン用プロンプトは負荷テスト用より長いが、すべてのモデルでスコアが高かった。これは、数やイベント順ではなく、静的な配置を説明する内容だったためだ。
このテストで答えられないこと
3回の実行があれば、これらのスコアが単なるサンプリングノイズではないことは示せる。しかし、ベンチマークと呼ぶには十分ではない。再試行したのはSeedance、Kling、Hailuoだけで、Veo 3.1、Wan 2.7、Grok Imagineは各1回の結果にとどまる。さらに、両プロンプトは単一ショット、セリフなし、10秒未満だ。実際の編集で崩れやすい指示、つまり複数ショット間の連続性、発話セリフ、名前付きキャラクターの再登場は、まったく検証していない。ここでの順位が示すのは、説明された1ショットを誰が守れるかだ。ショットリスト全体を乗り切れるかは次のテストであり、別の問いになる。
関連記事: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · AIカメラ移動プロンプトを検証