AIREITER

Wan2.2 Animate 완벽 가이드: 모드, 사양, API 요금과 설치법

마지막 업데이트: 2026-08-14 01:25:28

정지 이미지 속 캐릭터를 영상에 맞춰 움직이게 만들거나, 기존 영상의 배우를 다른 캐릭터로 바꾸고 싶다면 Wan2.2 Animate가 눈에 들어올 만합니다. Alibaba가 공개한 오픈소스 14B 캐릭터 애니메이션 모델로, 하나의 프레임워크에서 두 작업을 모두 처리합니다. 2025년 9월 19일 Apache-2.0 라이선스로 공개됐으며 ComfyUI나 공식 CLI로 로컬 실행할 수 있습니다. 다만 생성 버튼만 누른다고 결과가 깔끔하게 나오는 것은 아닙니다. FPS, 포즈 정렬, 마스크 설정이 결과 품질을 좌우합니다.

Wan2.2 Animate란?

Wan2.2-Animate-14B는 Wan-AI가 Wan2.2 I2V-A14B 이미지-투-비디오 모델을 바탕으로 만든 MoE 캐릭터 애니메이션 버전입니다. 모델 카드에 따르면 디노이징 단계마다 실제로 활성화되는 파라미터는 약 14B이며, 두 전문가를 합친 전체 규모는 27B입니다. 입력은 캐릭터 이미지와 드라이빙/레퍼런스 영상 두 가지입니다. 선택한 모드에 따라 영상 속 동작을 캐릭터 이미지에 입히거나, 장면은 유지한 채 원래 배우를 캐릭터로 교체합니다.

공식 가중치는 BF16으로 제공됩니다. 반면 ComfyUI 워크플로에서 사용하는 Wan2_2-Animate-14B_fp8 파일은 FP8 양자화 버전으로, 가중치를 16비트가 아닌 8비트 정밀도로 저장합니다. 가중치 메모리 사용량이 절반으로 줄어 소비자용 GPU에서도 모델을 구동하기 쉬워집니다.

Move와 Mix, 하나의 모델로 나뉘는 두 가지 작업

Wan2.2 Animate에는 두 가지 실행 모드가 있습니다. ComfyUI에서는 Move와 Mix라고 부르고, CLI와 공식 문서에서는 각각 animation과 replacement로 표기합니다. 두 모드 모두 스켈레톤 추출, 얼굴 특징의 암시적 추출, 캐릭터 이미지 참조라는 동일한 파이프라인을 공유하지만, 무엇을 보존하고 무엇을 바꾸는지가 다릅니다.

Move 모드(애니메이션)는 드라이빙 영상의 신체 동작과 표정을 캐릭터 이미지에 옮깁니다. 캐릭터 이미지가 주인공이고, 영상은 연기와 움직임을 제공하는 역할입니다. 정지된 초상화가 춤추는 아바타가 되거나, 콘셉트 캐릭터가 영상 속 안무를 그대로 따라 하게 만들 수 있습니다. 신체 움직임은 공간적으로 정렬된 스켈레톤 신호를 기반으로 하고, 표정은 원본 배우의 연기를 재타기팅합니다.

Mix 모드(교체)는 반대 방향의 작업입니다. 기존 영상 속 배우를 캐릭터 이미지로 바꾸면서 원래 장면은 유지합니다. 전용 Relighting LoRA가 삽입된 캐릭터를 원본 영상의 조명과 색감에 맞춰 보정하기 때문에, 캐릭터를 단순히 위에 붙인 듯한 이질감을 줄일 수 있습니다.

항목Move(애니메이션)Mix(교체)
무엇이 바뀌나정지 이미지가 움직이는 영상으로 변함영상 속 배우가 교체됨
무엇이 유지되나이미지 속 캐릭터의 정체성영상의 장면, 조명, 색감
동작 입력영상 속 움직임과 표정영상 속 연기
CLI 플래그--retarget_flag --use_flux--replace_flag --use_relighting_lora
포즈 재타기팅권장(신체 비율 차이에 대응)기본 비활성화(캐릭터와 환경의 상호작용 문제 때문)
적합한 용도콘셉트 캐릭터·아바타 애니메이션배우 교체, 브랜드 캐릭터 삽입

시스템 요구사항과 하드웨어

공식 저장소는 GitHub의 Wan-Video/Wan2.2이며 PyTorch ≥2.4.0이 필요합니다. 속도를 높이려면 FlashAttention을 사용하는 것이 좋지만, 첫 설치에서 문제가 생긴다면 나중에 설치해도 됩니다. 공식적으로 고정된 최소 VRAM이 공개된 것은 아니므로, 일반 소비자용 GPU에서는 FP8 경로와 모델 오프로딩 조합을 기준으로 보는 편이 현실적입니다. 다운로드 전에 사용하려는 ComfyUI 워크플로의 메모리 관련 안내도 반드시 확인하세요.

모델 카드의 효율성 측정 결과는 텍스트가 아닌 수치 자료로 제시되어 있습니다. 단일 GPU 실행에서는 모델 오프로딩과 데이터 타입 변환을 사용합니다. 커뮤니티에 공유된 벤치마크는 일부 환경에 한정됩니다. 예를 들어 한 r/comfyui 사용자는 마스킹과 인페인팅을 적용해 RTX 3070에서 춤 애니메이션을 생성했고, 연결된 변형 모델은 8 GB VRAM 편집을 내세웁니다. 다만 이는 전체 Animate-14B 파이프라인을 기준으로 한 결과가 아니라 부분적인 설정입니다.

Wan2.2 Animate 로컬 실행하기

로컬 실행 방법은 공식 CLI와 ComfyUI 두 가지입니다. 어떤 방식을 택하든 먼저 가중치를 내려받아야 합니다.

git clone https://github.com/Wan-Video/Wan2.2
huggingface-cli download Wan-AI/Wan2.2-Animate-14B --local-dir ./Wan2.2-Animate-14B

CLI로 실행하기

먼저 드라이빙 영상에서 스켈레톤과 얼굴 랜드마크를 추출하도록 전처리한 뒤 추론을 실행합니다. 선택한 모드에 따라 필요한 전처리 플래그가 달라집니다. 전체 인자 목록은 모델 카드의 실행 섹션에서 확인할 수 있습니다.

  • 애니메이션(Move): --retarget_flag --use_flux
  • 교체(Mix): --replace_flag --use_relighting_lora --iterations 3 --k 7 --w_len 1 --h_len 1

모델 카드의 예제 명령에 따르면 단일 GPU 실행에는 --refert_num 1을 사용합니다. 또한 다음과 같은 주의사항도 명시되어 있습니다. "Wan2.2로 학습한 LoRA 모델은 사용하지 않는 것을 권장합니다." 서드파티 LoRA가 가중치를 변경하면 애니메이션 파이프라인에서 예상하지 못한 동작이 발생할 수 있습니다.

ComfyUI로 실행하기

ComfyUI 네이티브 워크플로를 사용하려면 다음 모델 파일을 각각 지정된 폴더에 넣어야 합니다.

파일디렉터리역할
Wan2_2-Animate-14B_fp8_e4m3fn_scaled_KJ.safetensorsdiffusion_models/Kijai FP8 메인 가중치
umt5_xxl_fp8_e4m3fn_scaled.safetensorstext_encoders/UMT5 XXL 텍스트 인코더(FP8)
clip_vision_h.safetensorsclip_visions/CLIP Vision 인코더
wan_2.1_vae.safetensorsvae/Wan2.1 VAE
lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensorsloras/LightX2V 4단계 가속 LoRA

커스텀 노드도 두 개 필요합니다. ComfyUI-KJNodes와 comfyui_controlnet_aux이며, 후자는 스켈레톤 전처리에 사용하는 DWPose Estimator를 제공합니다. 실무적으로 기억해야 할 제약은 두 가지입니다. 출력 가로 또는 세로 길이는 16으로 나누어떨어져야 하고, 기본 생성 길이를 넘는 영상에서는 Video Extend 노드 하나가 77프레임(약 4.8초)을 추가합니다. Mix 모드를 활성화하려면 모든 연결을 유지하면 됩니다. Move 모드에서는 출력 서브그래프 노드에 연결된 background_video와 character_mask를 분리하세요.

호스팅 서비스별 API 요금 비교

로컬 설치가 부담스럽다면 Wan2.2 Animate를 호스팅하는 여러 서비스에서 사용량만큼 비용을 내고 이용할 수 있습니다. 표면적인 단가는 비슷해 보이지만, 실제 청구 기준이 서로 달라 최종 비용에는 차이가 생깁니다.

서비스480p720p청구 방식길이 제한
fal.ai$0.04/s$0.08/s프레임을 16 fps로 정규화하며, FPS가 높은 소스는 더 비쌈—
WaveSpeed$0.20 / 5s$0.40 / 5s출력 실행 1회 기준, 5초 단위로 구간 청구5–120s
APIXO$0.04/s$0.08/s감지된 레퍼런스 영상의 초 단위 청구최소 5s, 최대 120s
Replicate——추론 1,000초당 $3(출력 길이가 아닌 컴퓨팅 시간 기준)—

WaveSpeed는 5초 단위로 계산하지만 실질적인 단가는 480p에서 $0.04/s, 720p에서 $0.08/s로 환산됩니다. 따라서 표면적인 가격만 보면 fal.ai, WaveSpeed, APIXO는 서로 경쟁력 있는 수준입니다. 다만 무엇을 측정하는지가 핵심입니다. fal.ai는 프레임 수를 16 fps로 정규화하므로 30 fps 드라이빙 영상은 표시된 단가보다 실제 시간당 비용이 높아집니다. Replicate는 출력 길이가 아니라 GPU 추론 시간으로 청구합니다. 예를 들어 10초짜리 출력에 컴퓨팅 시간이 40초 걸리면 비용은 $0.12입니다. 사용을 결정하기 전에 각 엔드포인트가 어떤 모드를 제공하는지도 확인하세요. 위의 fal.ai URL은 Move/animation 엔드포인트를 직접 가리킵니다.

실제로 잘 되는 작업과 어려운 작업

공식 데모는 상당히 매끄럽지만, 커뮤니티 사용기를 보면 데모 품질과 로컬에서 첫 실행했을 때의 결과 사이에는 차이가 있습니다.

"비결이 뭔가요? 후처리인가요, 프레임 보간인가요?" — u/Grand-Summer9946, r/comfyui

해당 스레드와 공식 전처리 가이드를 종합하면, 다음과 같은 작업은 비교적 잘 되고 아래 조건에서는 문제가 생기기 쉽습니다.

잘 되는 작업: 비교적 정적인 배경 앞에서 한 명의 캐릭터가 춤추거나 움직이는 영상, 즉 단일 인물의 동작 전달에 강합니다. 원본 영상에서 인물이 정면을 향하고 표정 연기가 분명할수록 얼굴 표정 재현도 좋은 편입니다.

문제가 생기기 쉬운 경우:

  • 여러 명이 등장하는 장면. 마스크 추출은 한 명이 등장하는 영상만을 대상으로 설계됐습니다. 엉뚱한 포즈를 추적하는 일이 흔합니다.
  • 신체 비율이 다른 경우. 캐릭터 이미지와 드라이빙 영상 속 인물의 비율이 다르면 Mix 모드에서 아티팩트와 형태 변형이 발생합니다.
  • FPS 불일치. 드라이빙 영상의 FPS와 워크플로 설정이 맞지 않으면 끊김, 슬로 모션, 줌 아티팩트가 나타날 수 있습니다.
  • 마스크 세밀도. 거친 마스크는 배경을 더 많이 보존하지만 형태가 새어 나올 수 있고, 정교한 마스크는 생성 영역을 제한하는 대신 배경의 일관성을 해칠 수 있습니다.

원본 출력은 프리뷰나 콘셉트 테스트에 사용하기 충분합니다. 다만 제작 수준의 결과물을 얻으려면 관련 커뮤니티 스레드에서 언급한 것처럼 마스킹, 인페인팅, 프레임 보간을 추가로 적용해야 할 수 있습니다.

다른 Wan 모델과 비교한 Wan2.2 Animate

Wan은 빠르게 확장되는 모델 제품군이라 버전 이름만 보고 용도를 구분하기가 쉽지 않습니다. 모델 카드를 기준으로 Wan2.2 Animate의 위치를 정리하면 다음과 같습니다.

모델기능이 글과의 관계
Wan2.2-Animate-14B캐릭터 애니메이션 + 배우 교체(비디오-투-비디오)이 글의 주제
Wan-Animate-2커뮤니티에서 후속 모델로 소개된 모델r/LocalLLaMA에서 논의됨(2026)
Wan 2.7 Image Pro이미지 생성 및 편집(비디오 아님)모달리티가 다름: 정적 이미지
Wan 3범용 텍스트-투-비디오 / 이미지-투-비디오더 새로운 범용 비디오 모델이며, 전용 캐릭터 애니메이션 모드는 없음
Wan2.2-S2V-14B음성-투-비디오(오디오 기반 애니메이션)오디오로 움직임을 만드는 보조 모델

FAQ

Wan2.2 Animate는 여러 캐릭터를 한 번에 처리할 수 있나요?

아니요. 공식 전처리 가이드의 마스크 추출은 한 명이 등장하는 영상을 기준으로 구성되어 있어 두 모드 모두 실행 한 번에 캐릭터 한 명만 지원합니다. 여러 명이 등장하는 입력에서는 실패하거나 잘못된 포즈를 추적할 수 있습니다. 여러 캐릭터가 필요하다면 각각 따로 처리한 뒤 후반 작업에서 합성해야 합니다.

지원 해상도는 어떻게 되나요?

지원되는 워크플로 해상도는 480p와 720p이며, 공식 전처리 샘플은 1280×720을 사용합니다. 720p를 초과하는 해상도는 문서화되어 있지 않으므로, 더 높은 해상도가 필요하다면 별도 업스케일링 작업을 거쳐야 합니다.

생성물에는 어떤 라이선스가 적용되나요?

모델 코드와 가중치는 Apache-2.0 라이선스로 제공됩니다. Wan-AI는 생성 콘텐츠에 대한 권리를 주장하지 않지만, 사용자가 합법적이고 유해하지 않은 방식으로 사용할 책임이 있다고 명시합니다. 모델 카드는 불법 콘텐츠 생성, 취약 계층을 대상으로 한 사용, 악의적인 개인정보 이용을 금지합니다.

Wan2.2 Animate가 오디오도 생성하나요?

아니요. Animate는 영상만 생성합니다. 음성 기반 애니메이션, 즉 음성으로 립싱크를 만들고 싶다면 별도의 Wan2.2-S2V-14B 모델을 사용해야 합니다. Wan2.2 모델 카드의 업데이트 기록에 따르면 이 모델은 2025년 9월 5일 CosyVoice TTS 지원을 추가했습니다.


결론: 정지 이미지에 움직임을 넣을 때는 Move, 배우를 교체할 때는 Mix를 사용하면 됩니다. GPU와 ComfyUI 사용 경험이 있다면 로컬 실행이 적합하고, 빠르게 결과를 확인하려면 호스팅 API를 선택하세요. fal.ai, WaveSpeed, APIXO의 요금은 $0.04–0.08/s 수준이지만 fal.ai의 16 fps 정규화와 Replicate의 컴퓨팅 시간 기준 과금까지 예산에 반영해야 합니다.