Z-Image Turbo는 네거티브 프롬프트를 따로 쓰는 방식이 아니다. guidance는 0으로 두고, 원하는 요소와 피해야 할 요소를 모두 메인 프롬프트에 넣는다. 이미지 설명 뒤에 정리 조건까지 한 문장의 압축된 크리에이티브 브리프로 작성하는 방식이며, Tongyi-MAI와 fal 문서도 이 워크플로를 안내한다.
Z-Image Turbo 결과를 바꾸는 프롬프트의 첫 결정
태그를 무더기로 나열하기보다 자연어로 된 하나의 크리에이티브 브리프를 작성하는 편이 낫다. 이미지 유형과 피사체를 먼저 제시하고, 구도·환경·조명·스타일·제약 조건 순으로 구체화한다. 공식 모델 카드에 따르면 Turbo는 guidance_scale=0.0을 사용하는 8-NFE 증류 모델이다. fal 프롬프트 가이드 역시 네거티브 프롬프트를 지원하지 않는다고 명시한다.
아래 순서를 기본 틀로 삼으면 안정적이다.
- 이미지 유형과 구도: 클로즈업 인물 사진, 제품 사진, 에디토리얼 일러스트, 16:9 시네마틱 장면처럼 시작한다.
- 피사체와 행동: 무엇 또는 누구를 보여줄지, 무엇을 하는지, 외형에서 핵심이 되는 특징은 무엇인지 적는다.
- 환경: 장소와 시간대, 배경, 의미 있는 소품 한두 개를 정한다.
- 조명과 색감: 광원의 종류와 방향, 부드러움, 색온도, 주조색을 지정한다.
- 스타일 앵커: 다큐멘터리 사진, 깔끔한 제품 사진, 수채화처럼 하나의 매체를 중심으로 잡는다.
- 메인 프롬프트 안의 제약: 선명한 초점, 깨끗한 배경, 자연스러운 손, 정확한 인용문 텍스트, 워터마크 및 브랜딩 제외를 함께 적는다.
예쁘기만 한 프롬프트를 실무용으로 고치는 법
아래 수정 사례는 한 번에 하나의 제작 요건만 분리해 다룬다. 무작정 형용사를 추가하는 대신, 어떤 조건에서 실패했는지 파악할 수 있다.
형용사보다 먼저 시선의 우선순위를 잡는다
느슨한 프롬프트:
아름다운 여성이 정원에 있는 모습, 시네마틱, 매우 디테일한, 8K.
실무용 프롬프트:
빅토리아풍 정원에서 붉은 장미를 다듬는 성인 여성의 미디엄 인물 사진, 3/4 각도, 전경에 그녀의 손과 전지가위가 보임. 뒤에는 이끼 낀 돌담, 이른 아침, 참나무 잎 사이로 들어오는 얼룩진 햇빛, 차분한 녹색과 따뜻한 붉은색 팔레트, 다큐멘터리 라이프스타일 사진, 부드럽고 자연스러운 피부 질감, 얼굴과 손에 선명한 초점, 로고나 워터마크가 없는 깔끔한 구도.
두 번째 프롬프트는 촬영 유형, 행동, 깊이감, 빛, 팔레트 순으로 핵심을 제시한다. “아름다운”처럼 모호한 형용사만으로는 Z-Image Turbo가 그릴 구체적인 정보를 얻기 어렵다.
네거티브 프롬프트 대신 메인 프롬프트에 제약을 넣는다
Turbo 파이프라인에서는 negative_prompt: "blur, extra fingers, clutter" 같은 별도 필드에 기대지 말자. 원하는 특성과 제외할 요소를 모두 메인 프롬프트에 넣는다.
| 피하고 싶은 문제 | 메인 프롬프트에 넣어볼 표현 |
|---|---|
| 흐릿한 피사체 | sharp focus on the subject, crisp fine detail |
| 복잡한 배경 | simple clean backdrop, uncluttered negative space |
| 어색한 손 | natural hands with five clearly separated fingers |
| 원치 않는 브랜딩 | plain unbranded surface, no visible logo or watermark |
| 무작위 글자 | no extra lettering, only the quoted title is readable |
Turbo에는 별도 네거티브 프롬프트 필드가 없다. 그래도 “no watermark” 같은 제외 조건은 메인 프롬프트 안에 쓸 수 있다.
카메라 힌트는 하나만 넣는다
카메라나 필름 관련 힌트는 하나만 쓰고, 나머지 공간은 피사체와 레이아웃에 할애한다. 예를 들면 35mm street-photography framing, cool window light, visible fabric texture 정도면 충분하다.
8단계 기본값과 속도에만 매달리지 말아야 할 때
공식 Z-Image-Turbo 예시는 num_inference_steps=9를 사용하며, Tongyi-MAI 모델 카드는 이것이 DiT 순방향 패스 8회에 해당한다고 설명한다. 같은 예시에는 guidance_scale=0.0, 고정 시드, 1024 × 1024 이미지도 사용된다. 다만 재현 가능한 모델 설정과 보편적인 실제 시간 성능을 혼동해서는 안 된다. 프로젝트의 1초 미만 주장은 엔터프라이즈 H800 하드웨어 기준이며, 소비자 환경에서는 훨씬 느릴 수 있다.
fal 모델 페이지는 1~8단계 설정, 요청당 최대 4장, 최대 4메가픽셀 출력을 안내한다. 제작 루프에서는 낮은 단계로 러프 썸네일을 만들고, 보관할 가치가 있는 결과물은 8단계에 가깝게 올리는 방식이 합리적이다.
| 제어 항목 | 실전 시작점 | 바뀌는 점 |
|---|---|---|
| 추론 단계 | 8회 순방향 패스, 보통 설정값은 9로 노출 | Turbo의 품질과 지연 시간 사이 핵심 트레이드오프 |
| Guidance scale | 0.0 | Turbo는 일반적인 CFG 제어 없이 증류됨 |
| 해상도 | 균형 잡힌 테스트용 1024 × 1024 | 큰 출력은 비용이 늘고 구도 오류도 더 드러남 |
| 종횡비 | 정사각형·세로형·가로형 프리셋 | 게시 채널에 맞춰 캔버스를 선택 |
| 시드 | 프롬프트를 수정하는 동안 고정 | 표현 변경의 차이를 비교하기 쉬움 |
| 배치 | 지원 시 2~4개 변형 | 한 장을 믿기보다 결과를 골라낼 수 있음 |
| 프롬프트 확장 | 선택 사항, 주로 짧은 프롬프트용 | 디테일을 보완할 수 있지만 상세 브리프를 과도하게 풀어쓸 수 있음 |
빠른 대안 모델은 무엇이 다른가
공개 자료는 하드웨어와 설정이 서로 달라 직접 비교할 수 없다. 따라서 같은 GPU에서의 속도 비교가 아니라, 작업 방식의 차이로 봐야 한다.
| 모델 | 문서화된 빠른 경로 | 프롬프트 및 품질 트레이드오프 | 추천 선택 기준 |
|---|---|---|---|
| Z-Image Turbo | 8 NFE, 16 GB 소비자 기기 적합성 주장, H800에서 1초 미만 지연 시간 주장 | 강한 포토리얼리즘과 영문·중문 텍스트 성능을 내세우지만, 모델 표에서는 다양성이 낮게 평가되고 Turbo는 CFG를 쓰지 않음 | 대량의 첫 시안과 이중 언어 상업 콘셉트에 적합 |
| FLUX.1-schnell | 1~4단계, 공식 Diffusers 예시는 4단계와 guidance_scale=0.0 사용 | 폭넓은 로컬 생태계와 Apache 2.0 라이선스를 갖춘 12B 모델이며, 모델 카드는 실제 시간 벤치마크를 공개하지 않음 | Z-Image의 텍스트 강점보다 1~4단계 워크플로와 검증된 로컬 도구가 중요할 때 선택 |
| SDXL Turbo | 1~4단계, guidance_scale=0.0, 512 × 512에서 학습 및 기본 설정 | Diffusers 문서는 768²와 1024²에서 품질이 떨어질 수 있다고 경고하며, 상업 라이선스는 별도 확인이 필요함 | 512px 실시간 미리보기 또는 기존 SDXL 파이프라인에 적합 |
모델 표와 엔드포인트 문서는 어댑터 지원 여부에서 완전히 일치하지 않는다. 공식 모델 zoo는 Turbo의 파인튜닝 가능 여부를 N/A로 표시하지만, fal 가이드는 Turbo LoRA 엔드포인트를 문서화한다. LoRA 지원은 래퍼별 기능으로 보는 편이 좋다. 어댑터 학습이 핵심이라면 기본 Z-Image 모델이 더 안전한 출발점이다.
배치 생성에서도 재사용되는 프롬프트 패턴
배치 작업에서는 문구를 다듬는 동안 시드를 고정하고, 구도가 안정된 뒤에만 시드를 바꾼다.
작업은 3단계로 나누면 된다.
- 탐색: 짧고 구조화된 프롬프트와 여러 시드를 사용해 낮거나 균형 잡힌 단계 설정에서 시안을 만든다.
- 선별: 아이디어가 가장 잘 전달되는 구도를 고른 뒤, 시드를 고정하고 텍스트·손·제품 배치를 다듬는다.
- 마무리: 캠페인용 컷에 최대 수준의 디테일, 다양성, 파인튜닝이 필요하다면 선택한 콘셉트를 더 느리지만 제어력이 높은 모델로 옮긴다.
에디토리얼과 소셜 비주얼
썸네일 크기에서도 읽히는 시각적 은유 하나와 초점 하나를 사용한다.
템플릿: [subject]를 [visual metaphor]로 표현한 에디토리얼 일러스트, [foreground focal object]를 [left/center/right]에 배치, [simple background], [two-color palette], [lighting], 썸네일에서도 읽히는 깔끔한 구도, 텍스트 없음, 워터마크 없음.
예시: 붐비는 AI 콘텐츠 파이프라인이 한 명의 인간 편집자의 책상으로 좁혀지는 모습을 표현한 에디토리얼 일러스트, 오른쪽의 밝은 파란색 깔때기가 흩어진 종이 초안을 한 장의 선택된 페이지로 이끔, 따뜻한 주황색과 청록색 팔레트, 깔끔한 아이소메트릭 구도, 부드러운 스튜디오 조명, 텍스트 없음, 워터마크 없음.
제품과 패키지
제품 이미지는 분위기보다 형태와 표면 표현을 우선한다. 제품의 위치, 소재, 빛의 방향, 반드시 표시해야 하는 정확한 문구를 명시하자.
예시: 따뜻한 회색 석재 표면 위에 똑바로 세워진 무광 검정 커피 봉투, 정면에 가까운 3/4 제품 뷰, 좌측 상단의 소프트박스 조명, 오른쪽으로 제어된 그림자, 은은한 종이 질감, 프리미엄 패키지 사진. 전면 라벨에는 작은 크림색 세리프 대문자로 읽을 수 있는 텍스트 “YUNNAN COFFEE”만 포함, 다른 글자 없음, 로고 없음, 워터마크 없음.
패키지에 필요한 텍스트는 짧게 유지하고 정확히 인용하자. 공식 Z-Image 모델 카드는 영문과 중문 텍스트 렌더링을 강조하지만, 빽빽한 메뉴나 작은 글자 단락보다 짧은 라벨이 더 안전한 제작 목표다.
에어브러시처럼 보이지 않는 인물 사진
인물 사진에서는 “photorealistic”만 믿기보다 일상적인 행동, 구체적인 표정, 절제된 질감 힌트를 하나 추가한다.
예시: 동네 자전거 수리점 밖에서 자전거를 고치는 성인 남성의 자연스러운 미디엄 인물 사진, 약간 비대칭인 눈썹, 자연스러운 피부 질감, 낡은 네이비 작업 재킷, 카메라가 아닌 자전거에 시선 고정, 늦은 오후의 측면광, 차분한 파란색과 녹슨 갈색 팔레트, 35mm 다큐멘터리 사진, 손과 얼굴에 선명한 초점, 브랜딩 없는 깔끔한 배경.
텍스트가 포함된 이미지
정확한 텍스트는 충분히 주목받도록 앞부분에 넣고, 위치와 서체를 이어서 설명한다. 하나의 디자인에 영문과 중문이 함께 들어갈 때는 두 요소를 분리해 작성한다.
예시: 해 질 무렵의 포토리얼리즘 티바 외관, 중앙의 걸이 간판에 정확한 중국어 텍스트 “山茶”가 정확한 영어 텍스트 “MOUNTAIN TEA” 위에 배치됨, 둘 다 큰 크림색 세리프 글자, 따뜻한 실내 조명, 깔끔한 유리 파사드, 메뉴 보드에는 짧은 단어 “OOLONG”만 표시, 정돈된 도시 구도, 추가 텍스트 없음, 로고 없음, 워터마크 없음.
작고 빽빽한 라벨보다 크게 배치한 짧은 헤드라인이 더 안정적이다. 게시 전에는 반드시 텍스트 출력 결과를 확인하자.
사용자가 실제로 겪는 실패 사례와 해결 순서
아래 표는 시드나 실행 설정을 바꾸기 전에, 먼저 프롬프트에서 손볼 요소를 우선순위로 정리한 것이다. 한 사용자는 경험을 이렇게 요약했다.
“It was Z Image Turbo, it can be janky sometimes, and needs proper prompting but it can deliver really good stuff.” — @RodAndByte
| 증상 | 가장 먼저 바꿀 프롬프트 | 그다음 조치 |
|---|---|---|
| 플라스틱 같은 얼굴 또는 고정된 눈맞춤 | 현실적인 행동, candid, unposed, 명확한 시선 방향을 추가 | 문구가 안정된 뒤에만 시드 변경 |
| 텍스트가 틀어지거나 불필요한 단어가 생김 | 정확한 짧은 텍스트를 인용하고 크기와 위치를 지정하며 보조 문구 제거 | 다른 시드를 시도하고 최종 출력 크기에서 확인 |
| 제품 장면이 복잡해짐 | 소품을 한두 개로 제한하고 전경과 배경의 위치 정의 | 단계를 올리기 전에 스타일 관련 표현부터 줄이기 |
| 손 모양이 이상함 | 보이는 손의 동작을 설명하고 자연스러운 다섯 손가락 해부학을 요청 | 여러 시드를 생성하고 한 장에서 해결될 것이라 기대하지 않기 |
| 로컬 생성이 느리거나 불안정함 | 프롬프트를 고치기 전에 래퍼, dtype, GPU 메모리, 해상도 확인 | 처리량 테스트에는 호스팅 엔드포인트 사용 |
@iamzhihui와 @9o_zZz_o6의 보고를 보면 Mac, 구형 GTX 하드웨어, 여러 구성에 따라 로컬 속도는 달라진다. 프롬프트를 판단하기 전에 래퍼, dtype, 메모리, 해상도, 컴파일 상태를 먼저 테스트해야 한다.
Z-Image Turbo 프롬프트 가이드 FAQ
Z-Image Turbo에서 네거티브 프롬프트를 쓸 수 있나?
문서화된 Turbo 워크플로에는 별도 네거티브 프롬프트 필드가 없다. “no watermark” 같은 제외 조건과 원하는 특성을 모두 메인 프롬프트에 넣어야 한다.
추론 단계는 8과 9 중 무엇을 써야 하나?
엔드포인트의 표기 방식을 따르면 된다. Tongyi-MAI는 DiT 순방향 패스 8회를 위해 num_inference_steps=9를 사용하고, fal은 1~8 범위를 노출한다.
Z-Image Turbo 프롬프트는 어느 정도 길이가 적당한가?
커뮤니티 프롬프팅 매뉴얼과 MindCraft 가이드는 모두 대략 80~250단어를 작업 범위로 제시한다. 이는 공식 토큰 제한이 아니며, 디테일을 더하기 전에 경쟁하는 콘셉트부터 덜어내는 편이 좋다.
Z-Image Turbo는 FLUX schnell이나 SDXL Turbo보다 빠른가?
공개 자료에는 동일 하드웨어에서 비교한 공정한 지연 시간 테스트가 없다. Z-Image Turbo는 8 NFE를 사용하며, FLUX.1-schnell과 SDXL Turbo는 1~4단계를 문서화한다.
대규모 이미지 생성 배치에 적합한가?
그렇다. 첫 시안 생성과 선별 작업에는 적합하다. fal은 요청당 최대 4장을 지원하므로, 프롬프트 수정 시에는 시드를 고정하고 결과 선별을 위해서는 시드를 바꾸면 된다.
로컬 실행은 왜 느리거나 불안정한가?
1초 미만 주장은 H800 하드웨어 기준이다. 로컬 속도 저하를 프롬프트 실패로 판단하기 전에 VRAM, dtype, 해상도, 래퍼, 컴파일 상태를 확인해야 한다.