Hugging Face

Qwen/Qwen-Image-2.1-Turbo

Qwen-Image-2.1-Turbo: 8단계 이미지 생성·편집 모델

Qwen-Image-2.1-Turbo는 7B 시각 생성 아키텍처를 사용해 텍스트-이미지 생성과 이미지 편집을 8단계 디노이징으로 수행하는 모델 체크포인트입니다. Diffusers 파이프라인에 권장 샘플링 일정을 포함하며, 기본 CFG=1과 prefix KV 캐싱을 사용합니다.

AI 요약

Qwen-Image-2.1-Turbo는 Qwen-Image-2.1의 가속 체크포인트입니다. 텍스트로 이미지를 만들거나 입력 이미지를 편집하며, 생성 과정은 8단계 디노이징으로 구성됩니다. 기존 7B 시각 생성 아키텍처를 사용하고 Diffusers의 QwenImage21Pipeline으로 불러옵니다.

설치와 실행

CUDA를 지원하는 PyTorch 환경을 준비한 뒤, 최신 Diffusers 소스와 transformers>=5.17.0, accelerate, pillow를 설치합니다. 체크포인트를 torch.bfloat16으로 불러와 CUDA에 올리는 예제를 제공합니다. 텍스트-이미지 생성 예제는 1680×2512 세로 이미지이며, 입력 스케치에서 요트를 사실적인 사진으로 바꾸는 편집 예제는 2048×2048 해상도를 사용합니다.

샘플링과 캐싱

체크포인트에 권장 8단계 샘플링 일정이 저장되어 있어 별도로 스케줄러를 설정하지 않아도 파이프라인이 이를 불러옵니다. 기본 생성 설정은 CFG=1이며, prefix KV 캐싱으로 디노이징 단계 사이에 텍스트와 참조 이미지의 문맥을 재사용합니다. 이 기능을 지원하려면 파이프라인에 설정된 샘플링 시그마를 처리하는 Diffusers가 필요합니다. 해당 지원은 PR #14950에 추가됐습니다.

num_inference_steps만 설정해도 저장된 일정은 바뀌지 않습니다. 다른 일정을 실험하려면 호출 시 sigmas를 명시해야 합니다. 문서는 체크포인트에 저장된 일정 외의 샘플링 방식은 평가하지 않았다고 안내합니다. 해상도별 권장 프리셋도 함께 제시합니다. 예를 들어 1:1은 2048×2048, 16:9는 2752×1536, 9:16은 1536×2752입니다.

모델은 Qwen Research License Agreement를 따릅니다.

원문: Hugging Face / 번역·요약: Trawling