unsloth/Qwen-Image-2.1-GGUF
Qwen-Image-2.1 GGUF 양자화 모델
Unsloth가 Qwen-Image-2.1을 GGUF 형식으로 양자화해 공개했습니다. GGUF 파일은 이미지 생성 모델의 디노이저만 담으므로 VAE와 Qwen3-VL 텍스트 인코더도 함께 준비해야 합니다.
- 주제
AI 요약
Unsloth가 Qwen-Image-2.1의 GGUF 양자화 버전을 공개했습니다. 원 모델은 70억 개 파라미터의 시각 생성 구성 요소를 쓰며 텍스트 기반 이미지 생성과 이미지 편집을 지원합니다. 이번 저장소에는 GGUF 디노이저가 들어 있고, 실행 시 VAE와 Qwen3-VL 텍스트 인코더를 별도로 지정해야 합니다.
양자화 방식과 실행 구성
Unsloth Dynamic 2.0은 민감도 측정 결과를 바탕으로 중요한 레이어를 텐서별로 더 높은 정밀도로 올립니다. 저장소는 Unsloth Desktop, stable-diffusion.cpp 등에서 실행하는 방법을 안내합니다. 예시 명령은 Q4_K_M 디노이저, BF16 VAE, Q4_K_XL 텍스트 인코더를 지정하고 1024×1024 이미지 생성에 20 스텝, CFG 6.0, Euler 샘플링을 사용합니다.
텍스트 인코더는 Dynamic 2.0의 4비트 Q4_K_XL 버전을 권장합니다. 같은 시드에서 디노이저와 VAE를 고정하고 균일 양자화 Q4_K_M 인코더와 비교한 결과, LPIPS는 0.029, SSIM은 0.959였습니다. 메모리 사용량은 각각 5.15GB와 5.03GB였고 실행 시간은 36.5초와 39.0초였습니다. 저장소는 이 수치를 바탕으로 품질과 실행 시간의 차이를 제시합니다.
원 모델의 기능
Qwen-Image-2.1은 일반 이미지와 투명 배경 RGBA 이미지를 만들고, 투명 레이어 편집과 사진 속 피사체 추출을 지원합니다. 참조 이미지 최대 10장을 활용하며 원·칠한 표시·별도 마스크로 편집 영역을 지정할 수 있습니다. 저장소는 인물과 제품의 정체성 보존, 문자 표현, 인물 조명과 세부 묘사 개선도 기능으로 소개합니다. 모델 라이선스는 Qwen Research License Agreement입니다.
원문: Hugging Face / 번역·요약: Trawling