AIREITER

Qwen Image 2.1 리뷰: 로컬 VRAM, 라이선스, 테스트 결과

마지막 업데이트: 2026-09-20 18:59:47

Qwen Image 2.1은 더 이상 초기 액세스 단계의 소문이 아닙니다. Qwen은 2026년 9월 20일 오픈 웨이트 모델을 공식 발표했습니다. 이제 중요한 질문은 모델이 존재하느냐가 아니라, 상업적 사용이 제한된 상황에서 기본 투명도와 편집 워크플로가 약 33GB 규모의 로컬 설치를 감수할 만큼 가치가 있느냐입니다.

Qwen Image 2.1, 결론부터 말하면

로컬 환경에서 이미지 생성과 편집을 하고 싶거나, 투명 에셋과 다중 레퍼런스 합성이 필요하다면 Qwen Image 2.1을 테스트해볼 만합니다. 다만 현재 Qwen Research License는 비상업적 라이선스이고, 모델이 ‘7B’라는 표기에서 예상하는 것보다 훨씬 많은 메모리를 요구합니다. 따라서 상업용 프로덕션 파이프라인의 기본 선택으로 추천하기는 어렵습니다.

가장 잘 맞는 사용자는 워크플로를 직접 통제하고 싶은 크리에이터나 개발자, 그리고 16GB~48GB NVIDIA GPU를 보유한 사람입니다. 반대로 즉시 사용할 수 있는 상업적 권리, 예측 가능한 호스팅 처리량, 로컬 추론을 관리하지 않아도 일정한 품질을 원하는 팀에는 적합하지 않습니다.

Qwen Image 2.1 transparent image workflow with local GPU references

2026년 9월 20일 실제로 공개된 것

공식 Qwen 발표문에 따르면 Qwen Image 2.1은 이미지 생성과 편집을 하나로 통합한 오픈 웨이트 모델이며, 시각 생성 컴포넌트는 7B 규모입니다. 공식 저장소에는 샘플 이미지만 공개된 것이 아니라 구현 방식과 로컬 워크플로도 문서화돼 있습니다.

다음 세 가지는 서로 구분해서 봐야 합니다.

질문현재 답변중요한 이유
Qwen Image 2.1은 공식 출시됐나?그렇다. 오픈 웨이트로 발표·배포됐다소문이 아니라 실제 모델을 평가할 수 있다
넓은 의미의 ‘오픈 소스’ 모델인가?그렇게 단정해서는 안 된다라이선스가 사용 범위를 제한한다
전체 설치 용량이 7B 수준인가?아니다. 시각 컴포넌트가 7B일 뿐이며 별도의 대형 텍스트·비전 인코더가 필요하다VRAM과 저장 공간을 전체 파이프라인 기준으로 계산해야 한다

ComfyUI는 출시 당일 지원을 발표했고, 생태계에는 Diffusers와 관련 통합도 올라와 있습니다. 다만 지원 여부만으로 모든 문제가 해결되지는 않습니다. 사용 목적에 맞춰 워크플로, 체크포인트 버전, 양자화 방식, 라이선스를 각각 확인해야 합니다.

워크플로를 바꾸는 핵심 기능

생성과 편집을 하나의 체크포인트로

Qwen Image 2.1은 텍스트-이미지 생성과 이미지 조건부 편집을 하나의 파이프라인에서 처리합니다. 프롬프트만으로 새로운 장면을 만들 수 있고, 입력 이미지를 넣으면 지시문에 맞춰 기존 이미지를 수정할 수 있습니다. 생성기와 별도 편집기를 번갈아 사용해야 하는 작업이라면 한 모델군 안에서 두 작업을 처리할 수 있다는 점이 꽤 실용적입니다.

가장 큰 장점은 일관성입니다. 같은 모델 계열로 제품 장면을 만들고, 해당 장면을 수정하며, 원하는 시각적 레퍼런스를 유지할 수 있습니다. 그렇다고 모든 편집에서 세부 묘사가 완벽하게 보존된다는 뜻은 아닙니다. 초기 사용자들은 여전히 노이즈, 대비 변화, 인공적인 느낌이 강한 결과가 간헐적으로 나타난다고 보고합니다.

기본 제공되는 투명도와 다중 레퍼런스 편집

가장 눈에 띄는 기능은 네이티브 RGBA 출력입니다. Qwen의 발표문과 생태계 문서에 따르면 배경을 제거해야 하는 평면 이미지가 아니라 알파 채널을 포함한 투명 이미지의 생성과 편집이 가능합니다. 최대 10개의 레퍼런스 이미지를 사용할 수 있으며, 마스크나 다른 공간 지시를 이용해 이미지의 특정 영역을 편집할 수도 있습니다.

이 조합은 제품 누끼, 합성, 패키지 목업, 캐릭터 시트, 계속 수정해야 하는 에셋 제작에 유용합니다. 투명한 제품 이미지를 수정할 때 먼저 배경 제거 파이프라인으로 변환할 필요가 없기 때문입니다.

다만 이 기능이 완벽한 매팅을 의미하는 것은 아닙니다. 가는 경계선, 머리카락, 유리, 반투명 물체는 프로덕션 에셋 라이브러리에 넣기 전에 반드시 확인해야 합니다.

텍스트·제품·스토리보드형 작업

출시 자료는 텍스트 렌더링 개선, 인물, 제품 충실도, 파노라마, 인포그래픽, 스토리보드형 시퀀스를 주요 강점으로 내세웁니다. 이런 작업은 단순히 보기 좋은 인물 사진을 만드는 것보다 구도, 가독성 높은 타이포그래피, 레퍼런스 일관성을 함께 검증할 수 있어 초기 테스트 대상으로 적합합니다.

처음 평가할 때는 하나의 프롬프트를 네 가지 방식으로 테스트해보세요. 정확한 문구가 들어간 포스터, 두 개의 레퍼런스를 활용한 제품 이미지, 마스크를 이용한 부분 편집, 체크무늬 배경 위의 투명 피사체입니다. 서로 무관한 풍경 열 장을 만드는 것보다 실제로 필요한 실패 패턴을 훨씬 잘 확인할 수 있습니다.

16GB GPU에서 Qwen Image 2.1을 실행할 수 있을까?

실행은 가능합니다. 하지만 ‘실행된다’는 말과 ‘네이티브 2K 해상도에서 쾌적하게 돌아간다’는 말은 전혀 다릅니다. 커뮤니티 테스트에 따르면 16GB RTX 5070 Ti에서는 1024 정사각형 워크플로를 구동할 수 있었고, 피크 VRAM은 약 13.9GB, 20스텝 처리 시간은 약 25초였습니다. 별도의 4090 테스트에서는 BF16 기준 상주 메모리가 약 30.2GB였으며, 1024 정사각형 이미지는 약 21초, 1536 정사각형 이미지는 약 56초가 걸렸습니다.

이 수치는 공식 성능 보장이 아니라 사용자 측정값입니다. 하드웨어, 정밀도, 오프로딩 전략, 스텝 수, 소프트웨어 버전에 따라 결과는 달라질 수 있습니다.

“NVIDIA 5070 Ti GPU(16GB VRAM)에서 Qwen-Image-2.1을 테스트했습니다. 실행되고 속도도 꽤 빠릅니다. 1024² 이미지, 20스텝 기준 약 25초입니다.” — @BenjaminDEKR, X

현실적인 하드웨어 기준은 다음과 같습니다.

GPU 메모리현실적인 기대치
12GB공격적인 양자화나 오프로딩을 적용해야 가능하며, 타협이 필요하다
16GB1024 정사각형 테스트는 현실적이지만, 2K에서는 메모리와 속도가 급격히 부담될 수 있다
24GB한결 여유롭지만, 풀 프리시전 워크플로에는 여전히 최적화가 필요할 수 있다
48GBBF16 실험과 레퍼런스를 많이 사용하는 대형 작업에 가장 적합하다

‘7B’라는 표기만 보면 실제 배포 규모를 과소평가하기 쉽습니다. 파이프라인에는 Qwen3-VL 텍스트·비전 인코더와 기타 구성 요소도 포함되기 때문입니다. 다운로드하기 전에 약 33GB의 저장 공간을 확보하고, 캐시와 양자화 버전, 출력물을 위한 추가 공간도 남겨두세요.

실제 프로덕션을 막는 건 라이선스다

기술적으로 개방돼 있다고 해서 상업적 사용까지 제한 없이 허용되는 것은 아닙니다. Qwen Image 2.1의 출시 자료에는 비상업적 사용으로 범위를 제한하는 연구 라이선스가 명시돼 있습니다. 특히 이전 Qwen 이미지 릴리스가 더 허용적인 사용을 기대하게 만들었다는 점 때문에, 커뮤니티에서는 이 라이선스를 가장 큰 실무적 우려로 반복해서 지적했습니다.

따라서 로컬 테스트, 학술 실험, 개인 프로젝트와 유료 제품 이미지, 클라이언트 납품물, 호스팅 서비스, 상업용 에셋 라이브러리는 전혀 다른 판단이 필요합니다. 가중치를 다운로드할 수 있다고 해서 생성된 픽셀까지 상업적으로 사용할 수 있다고 해석해서는 안 됩니다.

상업적 작업이라면 Qwen에 적용 가능한 상업용 조건을 문의하거나, 사용 목적을 명시적으로 허용하는 라이선스의 모델과 API를 선택하세요. 출시 후 이미지 파이프라인을 다시 구축하는 것보다 사전에 법무 검토를 받는 편이 훨씬 저렴합니다.

초기 테스트에서 호평받은 점과 드러난 한계

초기 반응에서 가장 강하게 평가받는 부분은 모든 면에서 압도적인 화질이라기보다 워크플로 제어력입니다. 사용자들은 소비자용 GPU에서도 실행할 수 있고, 투명도를 유지하며, 여러 레퍼런스를 활용하고, 많은 로컬 대안보다 텍스트를 잘 처리한다고 평가합니다. 한 사용자는 여러 레퍼런스를 제공한 뒤 품질이 낮은 휴대폰 제품 사진을 전문적인 제품 이미지로 바꿀 수 있었다고 설명했습니다.

약점도 분명합니다. 커뮤니티 테스트에서는 입자감, 노랗거나 과도하게 대비가 강한 출력, 복원이나 편집 과정에서 세부 묘사가 바뀌는 현상이 언급됐습니다. 또한 현재 공개된 자료는 출시 당일 샘플에 집중돼 있습니다. 따라서 모든 벤치마크 점수를 안정적인 프로덕션 순위로 받아들이기에는 아직 이릅니다.

Qwen-Image-Bench 논문은 실제 사용 환경에서의 충실도와 창의적 생성을 56개의 세부 평가 기준으로 측정해 참고할 만한 맥락을 제공합니다. 다만 현재 검색 결과에 표시되는 공개 SOTA2 벤치마크 표에는 Qwen Image 2.0과 인접 모델이 나와 있을 뿐, Qwen Image 2.1에 대한 확정적인 독립 평가 결과는 없습니다. 다른 모델의 점수를 Qwen Image 2.1의 품질을 입증하는 근거로 사용해서는 안 됩니다.

Qwen Image 2.1과 호스팅 이미지 API 비교

핵심은 ‘오픈 모델이 항상 호스팅 모델보다 낫다’가 아니라, 로컬 제어력과 운영 편의성 중 무엇을 우선하느냐입니다.

필요 사항우선 검토할 선택지이유
당장 필요한 상업용 클라이언트 납품물상업적 라이선스가 있는 호스팅 API사용 권리와 처리량을 정의하기 쉽다
로컬 연구나 오프라인 실험Qwen Image 2.1이미지당 API 비용에 의존하지 않고 워크플로를 직접 확인할 수 있다
네이티브 알파와 반복적인 투명 이미지 편집Qwen Image 2.1, 경계선 테스트 후투명도가 애초에 의도된 파이프라인의 일부다
GPU 팀 없이 대량 프로덕션 운영호스팅 API용량, 과금, 가동 시간을 관리하기 쉽다
레퍼런스와 노드를 최대한 세밀하게 제어Qwen Image 2.1로컬 도구에서 더 많은 워크플로 요소를 직접 다룰 수 있다

Qwen Image 2.1의 핵심 장점은 모든 폐쇄형 모델을 확실히 앞섰다는 데 있지 않습니다. 생성, 편집, 레퍼런스, 마스크, 알파 출력을 하나의 오픈 웨이트 로컬 워크플로로 묶을 수 있다는 점이 진짜 강점입니다. 다만 그 라이선스가 비즈니스 목적을 허용하지 않는다면 이 장점은 사라집니다.

Qwen Image 2.1 FAQ

Qwen Image 2.1은 공식 출시됐나요?

네. Qwen은 2026년 9월 20일 오픈 웨이트 모델을 발표했고, 공식 저장소와 생태계 통합을 통해 출시 자료를 제공하고 있습니다. 다운로드한 파일을 배포하기 전에 저장소 버전과 라이선스를 확인하세요.

Qwen Image 2.1에는 어느 정도의 VRAM이 필요한가요?

커뮤니티 테스트에 따르면 16GB GPU에서도 제한적인 1024 정사각형 워크플로를 실행할 수 있습니다. 반면 4090에서 진행한 BF16 테스트는 약 30.2GB의 상주 메모리를 사용했습니다. 양자화와 오프로딩에 따라 결과가 달라지며, 네이티브 2K는 훨씬 더 높은 사양을 요구합니다.

Qwen Image 2.1로 투명한 PNG를 만들 수 있나요?

가능합니다. 네이티브 RGBA 출력은 이 모델의 대표 기능 중 하나입니다. 다만 알파 채널이 있다고 해서 프로덕션 품질이 자동으로 보장되는 것은 아니므로 경계선과 반투명 영역을 확인해야 합니다.

Qwen Image 2.1은 여러 레퍼런스 이미지를 지원하나요?

공식 출시 자료에는 최대 10개의 레퍼런스 이미지를 지원한다고 나와 있습니다. 다만 레퍼런스의 순서와 해상도, 이미지 간 시각적 관계에 따라 결과의 일관성이 달라질 수 있습니다.

Qwen Image 2.1은 ComfyUI에서 작동하나요?

ComfyUI는 출시 시점에 맞춰 지원을 발표했습니다. 유지 관리되는 워크플로와 해당 통합이 요구하는 정확한 체크포인트를 사용하세요. 임의의 워크플로 JSON을 가져오면 호환되지 않는 커스텀 노드나 버전이 필요할 수 있습니다.

Qwen Image 2.1을 상업적으로 사용할 수 있나요?

그렇다고 가정해서는 안 됩니다. 현재 연구 라이선스는 비상업적 사용을 전제로 하므로, 상업적 사용에는 별도의 허가나 라이선스가 필요합니다. 다운로드할 수 있다는 사실이 곧 상업적 사용 허가를 의미하지는 않습니다.

Qwen Image 2.1은 GPT Image 2나 다른 호스팅 모델보다 나은가요?

한쪽을 무조건 승자로 꼽을 수는 없습니다. Qwen은 로컬 환경에서 알파를 활용한 편집과 다중 레퍼런스 제어가 필요한 작업에 더 매력적입니다. 반면 호스팅 모델은 상업적 배포, 예측 가능한 운영, 로컬 GPU 인프라가 없는 팀에 더 편리합니다.

Qwen Image 2.1은 사진 복원에 적합한가요?

자신의 이미지로 직접 테스트하기 전까지는 사진 복원을 검증되지 않은 용도나 약한 사용 사례로 보는 편이 좋습니다. 초기 커뮤니티 보고에서는 복원형 편집 과정에서 세부 묘사가 바뀌거나 인공적인 입자감이 생긴다는 지적이 나왔습니다.

다음 단계: 권리부터 확인하는 파일럿 테스트

개인 작업이나 연구 목적이라면 Qwen Image 2.1을 내려받아 네 가지 테스트를 진행해보세요. 투명한 제품 누끼, 두 개의 레퍼런스를 활용한 제품 합성, 마스크 기반 부분 편집, 텍스트가 많은 포스터입니다. VRAM 사용량, 이미지 한 장당 처리 시간, 실패한 프롬프트, 경계선 품질을 기록하면 좋습니다.

상업적 작업이라면 ComfyUI 최적화보다 라이선스 검토를 먼저 시작하세요. Qwen Image 2.1은 기술적으로는 훌륭한 선택일 수 있지만, 상업적 권리가 명확해지기 전까지는 프로덕션에 잘못된 선택일 수 있습니다.