AIREITER

AI 동영상 생성기 프롬프트 준수율 테스트: 6개 모델 비교

마지막 업데이트: 2026-07-30 04:45:31

AI 동영상 모델의 프롬프트 준수율은 숫자만 보면 큰 차이가 나 보인다. 한 공개 리더보드는 Veo 3.1을 7.8점으로, 다른 곳은 9.2점으로 평가했다. 하지만 어느 쪽도 사용한 프롬프트를 공개하지 않았다. 그래서 2026-07-30에 확인 가능한 요소 20개를 담은 프롬프트 2개를 직접 작성해 6개 모델에 넣어 봤다. 결과적으로 모델 간 격차는 리더보드가 암시하는 수준만큼 크지 않았다. 차이를 가르는 것은 브랜드보다 어떤 종류의 지시를 내리느냐였다.

프롬프트를 가장 정확히 따르는 AI 동영상 모델은?

이번 테스트에서 가장 많은 지시를 따른 모델은 Seedance 2.0 Fast였다. 확인 항목 20개 중 19개를 충족했고, 더 까다로운 프롬프트에서는 10/10을 기록했다. Kling 3 Turbo와 Veo 3.1은 18점으로 동률, Wan 2.7은 17.5점, Grok Imagine은 16점이었다. Hailuo 02 Pro는 이벤트 시퀀스 전체를 무시해 15.5점으로 최하위였다. 어려운 프롬프트를 세 차례 반복 실행해도 이 순위는 바뀌지 않았다. Sora 2는 아예 테스트할 수 없었다.

모델정적 장면 프롬프트스트레스 프롬프트합계 /20클립당 비용초당 비용대기 시간
Seedance 2.0 Fast9.010.019.0$0.83$0.165121–132초
Kling 3 Turbo9.58.518.0$0.45$0.09045–54초
Veo 3.19.09.018.0$1.25$0.15688–95초
Wan 2.79.08.517.5$0.40$0.080103–104초
Grok Imagine8.08.016.0$0.09$0.01543–49초
Hailuo 02 Pro9.06.515.5$0.29$0.049166–185초
Sora 2—————제출 5회 실패

가격은 공개된 크레딧 요금을 기준으로 계산했다. Kling, Seedance, Wan, Hailuo, Grok은 Kie의 가격표를, Veo 3.1과 Sora 2는 각각 AIReiter 모델 페이지인 Veo 3.1, Sora 2를 참고했다. 이후 실제로 각 모델이 반환한 클립 길이로 나눠 아래 수치에 반영했다.

샷의 요구사항에 따라 고르면 된다.

  • 수량, 순서, 또는 “절대 움직이지 않음”이 들어간 프롬프트 → Seedance 2.0 Fast. 이런 항목 10개를 모두 맞힌 유일한 모델이었다. 더 높은 가격은 바로 이 정확도에 쓰인다.
  • 시퀀스보다 룩을 반복 조정하는 작업 → Kling 3 Turbo. 준수율은 거의 비슷하지만 가격은 약 절반이고 대기 시간은 3분의 1 수준이다.
  • 프롬프트가 영상으로 성립하는지 빠르게 확인할 때 → 초당 $0.015의 Grok Imagine. 16/20점의 대부분은 한 번의 등장 동작을 놓친 데서 발생했다.
  • 순서가 중요한 액션 → Hailuo 02 Pro는 피하는 편이 낫다. 이벤트 하나를 통째로 건너뛰었다.

Sora 2는 2026-07-30 03:57~03:59 UTC 사이, 두 프롬프트와 간격을 둔 세 번의 재시도를 포함한 다섯 번의 제출 모두에서 UPSTREAM_BUSY / Upstream service is busy or upgrading를 반환했다. 과금도, 생성된 클립도, 점수도 없었다.

테스트 방법: 확인 가능한 요소 20개를 두 프롬프트에 담았다

두 프롬프트의 모든 절은 프레임에서 눈으로 확인할 수 있는 요소에 대응한다. “cinematic”, “8k”, “moody”처럼 채점할 수 없는 표현은 넣지 않았다. 프롬프트당 10개 요소는 ✓(1점), ~(부분 충족, 0.5점), ✗(0점)로 표시했다. 이 테스트는 화질이나 시간적 일관성을 평가하지 않는다. 영상이 아름답고 안정적으로 보여도, 지시의 절반을 슬쩍 빠뜨릴 수 있기 때문이다. Grok Imagine의 결과물은 사진보다 3D 렌더링에 가깝게 보였지만, 이는 감점 대상이 아니었다.

정적 장면 프롬프트는 모델이 묘사된 장면을 조립할 수 있는지 확인한다. 10개 항목은 프롬프트에 명시한 그대로다. 빨간 빈티지 자전거 한 대, 노란 벽돌 벽에 기대어 있음, 검은 귀 하나를 가진 흰 고양이, 화면 오른쪽에서 등장, 앞바퀴 옆에 멈춰 위를 올려다봄, OPEN 7AM이라고 적힌 표지판, 와이드에서 미디엄으로 이어지는 돌리, 지면 높이의 카메라, 햇빛 없는 흐린 빛, 화면 속 인물 없음.

A single red vintage bicycle leans against a yellow brick wall on an empty
street at dawn. A white cat with one black ear walks in from the right side of
the frame, stops beside the front wheel, and looks up. A wooden sign above the
bicycle reads "OPEN 7AM". The camera dollies in slowly from a wide shot to a
medium shot, staying at ground level. Overcast morning light, no sun, no people
anywhere in the shot.

스트레스 프롬프트는 수 세기, 이벤트 순서, 부정을 시험한다. 확인 항목은 정확히 세 마리의 오리, 세 마리 모두 같은 크기 유지, 나무 테이블 위 한 줄 배치, 손과 사람이 없음, 가운데 오리가 먼저 넘어짐, 그 뒤 왼쪽 오리가 넘어짐, 오른쪽 오리는 절대 움직이지 않음, 고정 카메라, 평범한 흰 배경, 위쪽에서 직접 비추는 강한 조명이다.

Three identical yellow rubber ducks sit in a row on a wooden table. No hands and
no people appear at any point. First the middle duck tips over onto its side;
about two seconds later the duck on the left tips over. The duck on the right
never moves. The camera is locked off: no zoom, no pan, no push in. Plain white
background, hard light from directly above.

모델에 전달되기 전 프롬프트를 바꿔 버리는 설정

이 가운데 두 모델은 기본적으로 프롬프트 재작성 기능을 켠 상태로 제공된다. Wan 2.7의 prompt_extend, Hailuo 02 Pro의 prompt_optimizer가 그것이며, 문서상 두 설정 모두 기본값은 true다. 이 설정을 건드리지 않고 프롬프트를 제출하면, 실제로 채점하는 텍스트는 사용자가 쓴 텍스트가 아니다. 이번 테스트에서는 모두 false로 설정했다. 기본값을 유지하면 모델뿐 아니라 재작성기까지 함께 측정하게 된다.

일부 파라미터는 요청대로 적용되지 않았다. 모든 클립은 5초, 720p, 16:9로 요청했지만 세 모델은 이를 무시했다. 따라서 위의 초당 가격은 요청값이 아니라 실제 반환된 결과를 기준으로 계산했다.

모델요청값반환값청구 크레딧
Seedance 2.0 Fast5초, 720p, 16:95.0초, 1280×720165 (초당 33)
Kling 3 Turbo5초, 720p, 16:95.0초, 1280×72090 (초당 18)
Veo 3.15초, 16:98.0초, 1280×720호출당 125
Wan 2.75초, 720p, 16:95.0초, 1280×72080 (초당 16)
Grok Imagine6초(최소), 720p, 16:96.0초, 1280×72018 (초당 3)
Hailuo 02 Pro5초, 720p, 16:95.9초, 1920×108057

Hailuo 02 Pro 문서에 명시된 입력값은 프롬프트와 두 개의 스위치뿐이라 별도로 설정할 수 있는 항목이 없다. 두 번 모두 1080p로 반환됐다. Veo 3.1은 요청값과 무관하게 8초를 반환했고, Grok Imagine은 최소 6초를 명시한다.

6개 모델이 공통으로 잘한 것

대략적인 구도는 여섯 모델 모두 문제없이 처리했다. 전부 노란 벽돌 벽 앞에 빨간 빈티지 자전거 한 대를 배치했고, 화면 내 텍스트인 "OPEN 7AM"도 오탈자 없이 렌더링했다. 부정 지시 역시 모두 지켰다. 거리 장면 6개에는 사람이 한 명도 나타나지 않았고, 고정 카메라 오리 장면 6개에서는 카메라가 움직이지 않았다.

동일한 자전거와 고양이 프롬프트를 받은 6개 AI 동영상 모델의 결과. 각 클립 진행률 68% 지점의 프레임

모델이 흔들리는 지점: 네 가지 지시 유형

수량과 세부 속성

“검은 귀 하나를 가진 흰 고양이”를 정확히 구현한 모델은 6개 중 한 개뿐이었다. Hailuo 02 Pro만 다른 신체 부위는 흰색이고 귀 하나만 검은 고양이를 만들었다. Kling 3 Turbo와 Veo 3.1은 검은 귀를 구현했지만 검은 꼬리까지 추가했다. Wan 2.7은 양쪽 귀에 검은 얼룩을 퍼뜨렸고, Grok Imagine은 시암 고양이처럼 얼굴 전체에 마스크 무늬를 칠했다. Seedance 2.0 Fast는 거의 완전히 흰 고양이에 한쪽 귀 끝의 희미한 어두운 얼룩만 표현했다.

‘검은 귀 하나’ 지시를 각 모델이 처리한 방식을 보여 주는 6개 모델의 고양이 머리 세부 비교

모든 모델이 “검은 무늬가 있는 흰 고양이”라는 큰 의미는 이해했다. 그러나 Hailuo를 제외하면 “하나”를 수량으로 처리한 모델은 없었다. 이번 6개 결과에서는 속성의 개수를 맞히는 능력이 대략적 구도를 맞히는 능력보다 눈에 띄게 불안정했다.

이벤트 순서와 타이밍

오리 프롬프트는 명확한 순서를 요구했다. 가운데 오리가 넘어지고, 이어 왼쪽 오리가 넘어지며, 오른쪽 오리는 움직이지 않아야 한다. 네 모델은 이 순서를 올바르게 수행했다. Kling 3 Turbo는 2.0초와 4.9초, Seedance 2.0 Fast는 2.0초와 3.5초, Wan 2.7은 1.0초와 4.0초, Veo 3.1은 1.6초와 4.8초였다. 요청한 약 2초 간격을 정확히 맞힌 모델은 없었지만, 오른쪽 오리는 6개 클립 모두에서 움직이지 않았다.

Hailuo 02 Pro는 이 시퀀스를 전혀 수행하지 못했다. 가운데 오리는 끝내 넘어지지 않았다. 대신 왼쪽 오리가 옆모습으로 회전하면서 크기가 거의 두 배로 커졌고, 세 오리는 모두 계속 서 있었다.

6개 모델의 오리 시퀀스 테스트. 시작, 클립 중간, 마지막 프레임 비교

Grok Imagine은 오리를 올바른 순서로 넘어뜨렸지만, 옆으로 눕히는 대신 부리 쪽으로 앞으로 쓰러뜨렸다. Veo 3.1은 순서를 맞춘 뒤 마지막 프레임에서 넘어진 두 오리를 다시 일으켜 세웠다. 이벤트는 발생했지만 상태가 유지되지는 않았다.

카메라 지시 준수

고정 카메라 지시는 모두 지켰지만, 카메라 움직임 지시는 그렇지 않았다. Wan 2.7과 Veo 3.1은 요청한 와이드-미디엄 돌리를 시작한 뒤 계속 밀고 들어가 극단적인 클로즈업까지 갔다. Wan은 고양이가 완전히 프레임 밖으로 사라진 채 휠 림만 보이며 끝났다. Grok Imagine은 움직임이 너무 작아 푸시인이 거의 감지되지 않는다. Hailuo 02 Pro는 “지면 높이를 유지”하라는 지시를 어긴 유일한 모델이었다. 다른 다섯 모델은 낮은 시점에 머문 반면, 이 모델은 대략 허리 높이에서 촬영했다.

오브젝트 일관성

움직이는 오브젝트는 크기가 바뀌곤 한다. Hailuo의 왼쪽 오리는 시작 크기의 거의 두 배까지 커졌고, Grok Imagine에서 넘어진 두 오리도 모두 눈에 띄게 커졌다. Kling 3 Turbo와 Veo 3.1의 넘어진 오리도 소폭 확대됐다. 첫 프레임부터 마지막 프레임까지 세 오리의 크기를 유지한 모델은 Seedance 2.0 Fast와 Wan 2.7뿐이었다.

크기 일관성은 프롬프트에 쓰지 않아도 기대하게 되지만, 깨질 때까지는 알아차리지 못한다.

모델별 프롬프트 준수 요소 수. 정적 장면 프롬프트와 스트레스 프롬프트 각각 10점 만점

6개 중 5개 모델은 정적 장면에서 8.0~9.5점에 모였다. 차이는 수량과 순서 있는 이벤트에서 벌어졌고, Hailuo는 이 구간에서 2.5점 뒤처졌다. 단순한 샷에서는 모델 선택의 차이가 작지만, 프롬프트에 숫자가 들어가는 순간 그 차이는 커진다.

재실행해도 순위는 유지될까?

반복 실행한 세 모델에서는 그렇다. 스트레스 프롬프트를 각각 두 차례 더 시도해 같은 방식으로 채점했으며, 점수 범위는 서로 겹치지 않았다.

모델1회차2회차3회차중앙값범위
Seedance 2.0 Fast10.09.510.010.09.5–10.0
Kling 3 Turbo8.58.08.08.08.0–8.5
Hailuo 02 Pro6.56.5—6.5n=2

Kling 3 Turbo는 세 번 모두 요청한 평범한 흰 배경 대신 청회색 벽을 만들었다. 이는 샘플링 노이즈라기보다 안정적으로 나타나는 선호에 가깝다. Hailuo 02 Pro도 두 번 모두 똑같이 실패했다. 가운데 오리는 넘어지지 않았고 왼쪽 오리는 거의 두 배로 커졌다. Hailuo의 세 번째 실행은 일일 크레딧 한도에 막혀, 중앙값은 두 샘플에 기반한다.

Seedance, Kling, Hailuo의 스트레스 프롬프트 반복 실행 결과

반복 실행에서는 단일 테스트로는 가려졌던 새 패턴도 보였다. Kling 3 Turbo는 2회차에서 가운데 오리를 넘어뜨린 뒤 마지막 프레임 전에 다시 세웠다. Veo 3.1이 유일한 실행에서 보인 것과 같은 상태 복귀 현상이다. 이벤트는 일어나지만 상태가 반드시 유지되지는 않는다.

모델이 지시를 무시했을 때 재시도 비용

가격과 속도는 비례하지 않았다. Hailuo 02 Pro는 클립당 비용이 두 번째로 저렴했지만 166~185초로 가장 느렸다. 반면 Kling 3 Turbo는 45~54초 만에 18/20 결과를 냈다. 클립당 가격은 짧은 클립을 반환하는 모델에 유리하게 보일 수도 있다. Veo 3.1은 $1.25로 Seedance 2.0 Fast의 $0.83보다 비싸지만, Veo는 8초를 반환하고 Seedance는 5초를 반환한다. 초당 비용으로 보면 $0.156과 $0.165로 거의 같다.

Seedance 2.0 Fast의 초당 33크레딧 가격을 보여 주는 Kie 가격표

이 글의 기반이 된 17개 클립에는 Kie 크레딧 1,387개와 AIReiter 크레딧 250개가 들었다. 달러당 200크레딧과 100크레딧 기준으로 환산하면 $9.44다. 실패한 Sora 2 제출 5회는 비용이 들지 않았다. 생성 자체는 저렴하다. 하지만 네 번째 요소가 빠졌는데 체크리스트가 없어 세 번씩 생성한다면 이야기가 달라진다.

r/SoraAi의 한 게시자는 이렇게 표현했다. "아무리 명확하고 상세하게, 또 제한적으로 프롬프트를 써도 SORA는 기본적인 시각 지시를 계속 무시합니다." 요소 단위 채점은 이 문제를 어떤 지시가 무시됐는지의 목록으로 바꿔 준다. 그리고 그 목록은 실제로 대응할 수 있다.

내 샷 리스트에 이 테스트 적용하는 법

  1. 실제 프롬프트 하나를 골라 모든 절을 검증 가능하게 다시 쓴다. “cinematic” 대신 카메라 높이, 조명 방향, 카메라 이동이 끝나는 프레임을 명시한다.
  2. 생성하기 전에 이를 번호가 매겨진 요소 목록으로 나눈다. 10개면 충분하다. 적어 두지 않으면 기억에 의존해 평가하게 되고, 점수는 관대해진다.
  3. 재작성 기능을 끈다. Wan에서는 prompt_extend를 false로, Hailuo에서는 prompt_optimizer를 false로 설정한다. 비교 전에 사용 중인 플랫폼에도 자체 재작성 기능이 있는지 확인한다.
  4. 동일한 문자열을 길이와 해상도를 맞춰 두세 모델에 전송하고, 각 모델이 어떤 설정을 조용히 덮어쓰는지 기록한다.
  5. 첫 프레임, 중간 프레임, 마지막 프레임을 체크포인트로 삼아 클립 전체를 검토한다. 짧은 상태 실패는 샘플 프레임 사이에서 발생할 수 있다. 그다음 실제로 중요한 요소를 놓친 모델만 재실행한다. 검은 귀 하나가 빠진 것은 중요하지 않을 수 있지만, 넘어진 오리가 다시 일어나는 것은 중요할 수 있다.

실행을 직접 재현하고 싶다면 Veo 3.1, Seedance 2 Fast, Sora 2의 모델 페이지에서 위 테스트에 사용한 정확한 모델 ID와 초당 크레딧 가격을 확인할 수 있다.

FAQ

가장 정확한 AI 동영상 생성기는 무엇인가요?

이번 테스트에서는 Seedance 2.0 Fast가 가장 정확했다. 확인 가능한 요소 20개 중 19개를 충족했고, 수량·순서·부정 지시를 모두 통과한 유일한 모델이었다. 다만 단순한 장면에서는 6개 중 5개 모델의 정확도가 거의 같았으므로, 순위 차이는 시퀀스가 있는 프롬프트에서만 뚜렷하게 나타난다.

Seedance가 Veo 3.1이나 Sora 2보다 나은가요?

Seedance 2.0 Fast는 Veo 3.1보다 1점 높은 19점 대 18점을 기록했고, 클립당 가격은 3분의 2 수준이었다. 두 모델 모두 오리 시퀀스를 올바른 순서로 수행했다. Sora 2는 순위를 매길 수 없다. 2026-07-30의 다섯 번 제출이 모두 업스트림 오류로 실패했기 때문에, 낮은 점수가 아니라 점수 자체가 없다.

프롬프트가 복잡한 작업에 Kling 3 Turbo는 가치가 있나요?

속도가 시퀀싱보다 중요하다면 그렇다. Kling 3 Turbo는 정적 장면 프롬프트에서 6개 모델 중 가장 높은 9.5/10을 기록했고, 반환 시간도 45~54초였다. 다만 스트레스 프롬프트에서는 평범한 흰 배경 대신 청회색 벽을 만들어 1점을 잃었다.

프롬프트가 길면 준수율도 높아지나요?

프롬프트 길이만으로는 그렇지 않다. 이 테스트의 정적 장면 프롬프트는 스트레스 프롬프트보다 길지만, 모든 모델이 정적 장면에서 더 높은 점수를 받았다. 정적 배치를 묘사하는 절들인 반면, 스트레스 프롬프트는 수량과 이벤트 순서를 요구했기 때문이다.

이 테스트가 답하지 못하는 부분

세 번의 실행은 이 점수가 단순 샘플링 노이즈가 아니라는 점을 보여 주기에는 충분하지만, 벤치마크라고 부르기에는 부족하다. 반복 실행한 모델은 Seedance, Kling, Hailuo뿐이다. Veo 3.1, Wan 2.7, Grok Imagine은 여전히 각각 한 번의 시도에 기반한다. 두 프롬프트 모두 단일 샷이고 대사가 없으며 10초 미만이다. 따라서 실제 편집에서 가장 문제가 되기 쉬운 지시 유형, 즉 멀티샷 연속성, 대사, 이름 있는 캐릭터의 재등장 등은 전혀 시험하지 못했다. 위 순위는 묘사된 하나의 샷을 누가 잘 따르는지 알려 준다. 샷 리스트 전체에서도 살아남는지는 다음 테스트에서 다뤄야 할 별개의 문제다.

관련 글: Seedance 2.0 vs Kling 3.0 vs Sora 2 vs Veo 3.1 · AI 카메라 무브먼트 프롬프트 테스트