AIREITER

Следование промптам в AI-видеогенераторах: тест 6 моделей

Последнее обновление: 2026-07-30 04:47:29

Публичные рейтинги оценивают следование Veo 3.1 промптам то в 7,8 балла, то в 9,2 балла — но сам промпт не показывает никто. Поэтому 2026-07-30 мы взяли два промпта с двадцатью отдельно проверяемыми требованиями и прогнали их через шесть моделей. Разрыв между моделями оказался куда меньше, чем можно подумать по лидербордам. Гораздо важнее не бренд, а тип инструкции.

Какая AI-модель лучше всего следует промпту

Лучший результат в этом тесте у Seedance 2.0 Fast: 19 из 20 проверяемых элементов и безупречные 10/10 на сложном промпте. Kling 3 Turbo и Veo 3.1 набрали по 18 баллов, Wan 2.7 — 17,5, Grok Imagine — 16, а Hailuo 02 Pro — 15,5: модель проигнорировала целую последовательность событий. Три повторных прогона сложного промпта сохранили этот порядок. Sora 2 протестировать вовсе не удалось.

МодельБуквальный промптСтресс-промптИтого /20Цена за роликЗа секундуОжидание
Seedance 2.0 Fast9.010.019.0$0.83$0.165121–132 с
Kling 3 Turbo9.58.518.0$0.45$0.09045–54 с
Veo 3.19.09.018.0$1.25$0.15688–95 с
Wan 2.79.08.517.5$0.40$0.080103–104 с
Grok Imagine8.08.016.0$0.09$0.01543–49 с
Hailuo 02 Pro9.06.515.5$0.29$0.049166–185 с
Sora 2—————5 неудачных отправок

Цены рассчитаны по опубликованным тарифам в кредитах: из таблицы цен Kie для Kling, Seedance, Wan, Hailuo и Grok, а также со страниц моделей AIReiter для Veo 3.1 и Sora 2. Стоимость разделили на фактическую длину ролика, которую вернула каждая модель; данные сведены в таблицу ниже.

Выбирать модель стоит под конкретную задачу:

  • В промпте есть число, порядок действий или запрет на движение → Seedance 2.0 Fast. Это единственная модель, которая верно выполнила все десять таких требований; за это и платите больше.
  • Нужно быстро перебирать визуальный стиль, а не сложную последовательность → Kling 3 Turbo. Послушность почти та же, цена примерно вдвое ниже, а ждать приходится втрое меньше.
  • Нужно проверить, вообще читается ли промпт → Grok Imagine за $0.015 в секунду. Его 16/20 — это в основном одна пропущенная сцена входа в кадр.
  • Важна последовательность действий → не Hailuo 02 Pro: модель пропустила целое событие.

Все пять отправок в Sora 2 между 03:57 и 03:59 UTC 2026-07-30 завершились ошибкой UPSTREAM_BUSY / Upstream service is busy or upgrading. Были использованы оба промпта и три разнесённые по времени повтора: ни списаний, ни роликов, ни оценки.

Методика: два промпта и 20 проверяемых пунктов

Каждая часть обоих промптов привязана к тому, что можно увидеть в кадре. Никаких «кинематографично», «8k» или «атмосферно»: такие формулировки нельзя объективно оценить. За каждый из десяти пунктов в промпте ставился ✓ (1 балл), ~ (0,5 балла, выполнено частично) или ✗ (0). Качество картинки и временная стабильность здесь не оцениваются: ролик может быть красивым и плавным, но при этом незаметно проигнорировать половину инструкций. Вывод Grok Imagine больше похож на 3D-рендер, чем на фотографию, но это не повлияло на его балл.

Буквальный промпт проверяет, способна ли модель собрать описанную сцену. В нём десять условий: один красный винтажный велосипед у стены из жёлтого кирпича, белая кошка с одним чёрным ухом, входящая справа, останавливающаяся у переднего колеса и смотрящая вверх, вывеска с надписью OPEN 7AM, наезд камеры от общего до среднего плана, камера на уровне земли, пасмурный свет без солнца и отсутствие людей в кадре.

A single red vintage bicycle leans against a yellow brick wall on an empty
treet at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.

Стресс-промпт проверяет счёт, порядок событий и отрицания. Его десять условий: ровно три утки, все одного размера, стоят в ряд на деревянном столе, в кадре нет рук и людей, первой падает средняя утка, затем левая, правая не движется вообще, камера неподвижна, фон чисто белый, а сверху идёт жёсткий свет.

Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.

Настройки, которые переписывают промпт до передачи модели

У двух моделей по умолчанию включён перефразировщик промпта: prompt_extend у Wan 2.7 и prompt_optimizer у Hailuo 02 Pro. В документации обе настройки указаны со значением по умолчанию true. Если просто отправить промпт, модель получит уже не тот текст, который написали вы. В этом тесте оба параметра были выставлены в false: иначе измеряется не только модель, но и работа перефразировщика.

Другие параметры модели тоже не всегда соблюдают. Для каждого ролика запрашивались 5 секунд, 720p и 16:9, но три модели эти настройки переопределили. Поэтому стоимость секунды в таблице выше рассчитана по полученному, а не по заказанному результату:

МодельОтправленоПолученоСписано кредитов
Seedance 2.0 Fast5 с, 720p, 16:95.0 с, 1280×720165 (33/с)
Kling 3 Turbo5 с, 720p, 16:95.0 с, 1280×72090 (18/с)
Veo 3.15 с, 16:98.0 с, 1280×720125 за запрос
Wan 2.75 с, 720p, 16:95.0 с, 1280×72080 (16/с)
Grok Imagine6 с (минимум), 720p, 16:96.0 с, 1280×72018 (3/с)
Hailuo 02 Pro5 с, 720p, 16:95.9 с, 1920×108057

У Hailuo 02 Pro в документации заявлены только промпт и два переключателя, поэтому установить длительность или разрешение нельзя; оба раза модель вернула 1080p. Veo 3.1 выдавала 8 секунд независимо от отправленных параметров, а для Grok Imagine задокументирован минимум в 6 секунд.

Что получилось у всех шести моделей

На базовой композиции не провалилась ни одна из шести моделей. Все сгенерировали ровно один красный винтажный велосипед у жёлтой кирпичной стены и без единой ошибки вывели текст OPEN 7AM. Все также выполнили оба запрета: в уличных сценах не появилось людей, а в роликах с утками камера оставалась неподвижной.

Шесть AI-видеомоделей с одинаковым промптом про велосипед и кошку; кадр взят на 68 процентах длительности каждого ролика

Где модели ошибаются: четыре типа инструкций

Счёт и точность атрибутов

Инструкцию «белая кошка с одним чёрным ухом» в точности выполнила лишь одна модель из шести. Только Hailuo 02 Pro показала кошку с единственным чёрным ухом на в остальном белом теле. Kling 3 Turbo и Veo 3.1 правильно сделали чёрное ухо, но добавили чёрный хвост. Wan 2.7 размазала чёрное пятно по обоим ушам, Grok Imagine нарисовала полноценную сиамскую маску, а Seedance 2.0 Fast выдала почти полностью белую кошку с едва заметным тёмным пятном на кончике уха.

Детали головы кошки у шести моделей: как каждая выполнила инструкцию про одно чёрное ухо

Все модели поняли запрос «белая кошка с чёрной отметиной». Но только Hailuo восприняла слово «одно» именно как число. В этих шести результатах количество атрибутов оказалось заметно менее надёжным, чем грубая композиция кадра.

Порядок и тайминг событий

Промпт с утками требовал чёткой последовательности: сначала падает средняя утка, затем левая, а правая остаётся неподвижной. Верно её выполнили четыре модели: Kling 3 Turbo — на 2,0 и 4,9 секунды, Seedance 2.0 Fast — на 2,0 и 3,5 секунды, Wan 2.7 — на 1,0 и 4,0 секунды, Veo 3.1 — на 1,6 и 4,8 секунды. Никто не выдержал запрошенный двухсекундный интервал точно, но правая утка осталась на месте во всех шести роликах.

Hailuo 02 Pro не выполнила последовательность вовсе. Средняя утка так и не упала. Вместо этого левая повернулась боком и выросла почти вдвое, тогда как все три остались стоять.

Тест последовательности с утками у шести моделей: начало, середина и финальный кадр

Grok Imagine опрокинула уток в нужном порядке, но они падали вперёд, на клюв, а не на бок. Veo 3.1 верно соблюла порядок, однако к финальному кадру обе упавшие утки снова встали — событие произошло, но состояние не сохранилось.

Дисциплина камеры

Неподвижную камеру соблюли все, а вот заданное движение камеры — нет. Wan 2.7 и Veo 3.1 начали с требуемого наезда от общего к среднему плану, но продолжили двигаться до экстремального крупного: Wan закончила на голом ободе колеса, полностью убрав кошку из кадра. Grok Imagine двигалась настолько слабо, что наезд едва заметен. Единственной моделью, нарушившей требование держать камеру на уровне земли, стала Hailuo 02 Pro: её камера находилась примерно на высоте бёдер, тогда как остальные пять снимали низко.

Постоянство объектов

При движении объекты меняют размер. Левая утка Hailuo выросла почти вдвое относительно начального размера, обе упавшие утки Grok Imagine тоже заметно увеличились, а у Kling 3 Turbo и Veo 3.1 слегка выросли опрокинутые утки. Только Seedance 2.0 Fast и Wan 2.7 сохранили одинаковый размер всех трёх уток от первого до последнего кадра.

Постоянство размера обычно не прописывают в промпте — и потому редко замечают, когда оно нарушается.

Количество выполненных из десяти элементов для каждой модели: буквальный и стресс-промпт

Пять из шести моделей укладываются в диапазон 8,0–9,5 на статичной сцене и начинают заметно расходиться только на подсчёте и упорядоченных событиях, где Hailuo теряет 2,5 балла. Для простого кадра выбор модели почти ничего не меняет, но как только в промпте появляется число, разница становится существенной.

Сохраняется ли рейтинг при повторном запуске?

Да — у трёх моделей, которые мы запускали повторно. Каждая получила ещё по две попытки на стресс-промпте с той же системой оценки, и диапазоны результатов не пересеклись.

МодельЗапуск 1Запуск 2Запуск 3МедианаДиапазон
Seedance 2.0 Fast10.09.510.010.09.5–10.0
Kling 3 Turbo8.58.08.08.08.0–8.5
Hailuo 02 Pro6.56.5—6.5n=2

Во всех трёх запусках Kling 3 Turbo рисовала сине-серую стену вместо требуемого чистого белого фона. Это устойчивое предпочтение модели, а не случайность семплирования. Hailuo 02 Pro в точности повторила свою ошибку оба раза: средняя утка не падала, а левая раздувалась почти вдвое. Третий прогон Hailuo не состоялся из-за дневного лимита кредитов, поэтому её медиана основана на двух образцах.

Повторные прогоны стресс-промпта для Seedance, Kling и Hailuo

Повторы выявили и поведение, которое не было видно в одиночных запусках. Во втором прогоне Kling 3 Turbo средняя утка упала, а затем до финального кадра снова встала — то же возвращение состояния, которое Veo 3.1 показала в единственном запуске. События происходят, но их результат сохраняется не всегда.

Во сколько обходится повтор, когда модель вас игнорирует

Цена и скорость здесь не связаны напрямую. Hailuo 02 Pro была второй по дешевизне за ролик, но с большим отрывом самой медленной: 166–185 секунд. Kling 3 Turbo выдавала свои 18/20 за 45–54 секунды. Цена за ролик также выгоднее выглядит у моделей с короткими клипами: Veo 3.1 стоит $1.25 против $0.83 у Seedance 2.0 Fast, но Veo возвращает 8 секунд, а Seedance — 5. В пересчёте на секунду они почти равны: $0.156 и $0.165.

Таблица цен Kie: Seedance 2.0 Fast стоит 33 кредита за секунду

17 роликов, на которых основана эта статья, обошлись в 1 387 кредитов Kie и 250 кредитов AIReiter. При курсах 200 и 100 кредитов за доллар это $9.44; пять неудачных отправок в Sora 2 ничего не стоили. Сама генерация недорога. Дорого становится, когда приходится генерировать трижды, потому что четвёртый элемент исчез, а чек-лист этого не заметил.

Как написал один пользователь r/SoraAi: "No matter how clear, detailed, or restrictive I make the prompt, SORA consistently ignores basic visual instructions." Оценка по отдельным элементам превращает это в список конкретных игнорируемых инструкций — а с таким списком уже можно работать.

Как проверить модели на собственном шот-листе

  1. Перепишите один реальный промпт так, чтобы каждую его часть можно было проверить. Вместо «кинематографично» укажите высоту камеры, направление света и кадр, на котором заканчивается движение.
  2. До генерации разбейте промпт на нумерованный список элементов. Десяти пунктов достаточно; запишите их, иначе будете оценивать по памяти и завышать баллы.
  3. Отключите перефразировщики. Установите prompt_extend в false для Wan, prompt_optimizer в false для Hailuo и перед сравнением проверьте, нет ли такого механизма на вашей платформе.
  4. Отправьте идентичную строку в две или три модели с одинаковой длительностью и разрешением, затем отметьте, какие параметры каждая из них молча переопределила.
  5. Просмотрите ролик целиком, используя первый, средний и последний кадры как контрольные точки: кратковременные нарушения состояния могут происходить между выборками. Затем повторно запустите только ту модель, которая пропустила важные именно вам элементы. Пропавшее чёрное ухо несущественно; утка, которая снова встала, — существенно.

Если хотите воспроизвести наши запуски напрямую, на страницах моделей Veo 3.1, Seedance 2 Fast и Sora 2 указаны точные ID моделей и цены в кредитах за секунду, использованные выше.

FAQ

Какой AI-видеогенератор наиболее точен?

В этом тесте — Seedance 2.0 Fast: 19 из 20 проверяемых элементов и единственный безупречный результат на счёте, порядке действий и отрицаниях. На простых сценах точность пяти из шести моделей почти не различалась, поэтому рейтинг разделяет их только на промптах с последовательностью событий.

Seedance лучше Veo 3.1 или Sora 2?

Seedance 2.0 Fast обошла Veo 3.1 на один балл, 19 против 18, при цене за ролик в две трети от стоимости Veo; обе модели верно выполнили последовательность с утками. Оценить Sora 2 мы не можем: все пять отправок 2026-07-30 завершились ошибкой на стороне сервиса. У неё здесь нет оценки, а не низкий балл.

Подходит ли Kling 3 Turbo для работы со сложными промптами?

Да, если скорость важнее сложной последовательности. Kling 3 Turbo показала лучший среди всех шести результат на буквальном промпте — 9.5/10 — и вернула ролик за 45–54 секунды. Но на стресс-промпте потеряла балл, выдав сине-серую стену вместо запрошенного чистого белого фона.

Улучшает ли длинный промпт соблюдение инструкций?

Сам по себе — нет. Буквальный промпт в этом тесте длиннее стресс-промпта, однако все модели получили на нём более высокие баллы: его части описывают статичное расположение объектов, а не количество и порядок событий.

На что этот тест не даёт ответа

Трёх запусков достаточно, чтобы показать: эти оценки не сводятся к случайности семплирования. Но этого недостаточно, чтобы назвать их полноценным бенчмарком. Повторно запускались только Seedance, Kling и Hailuo; результаты Veo 3.1, Wan 2.7 и Grok Imagine по-прежнему основаны на одной попытке. Оба промпта также описывают один кадр, не содержат диалогов и длятся меньше десяти секунд. Поэтому самые уязвимые для реального монтажа типы инструкций — непрерывность между несколькими кадрами, реплики, повторное появление персонажа с именем — остались совершенно непроверенными. Этот рейтинг показывает, кто лучше следует описанию одного кадра. Выдержит ли модель целый шот-лист — следующий и совершенно другой тест.

Читайте также: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · Тест промптов для движения камеры в AI