abenzerps/Qwen-Image-2.1-Uncensored-GGUF
Qwen-Image 2.1 무검열 GGUF 양자화 모델 — ComfyUI 로컬 이미지 생성용
Qwen-Image 2.1을 GGUF 형식으로 양자화해 ComfyUI에서 로컬 이미지 생성에 쓰도록 패키징한 모델입니다. Q4_K_M부터 Q8_0까지 제공하지만 현재 Q8_0은 RMSNorm 양자화 문제로 샘플링 오류가 발생해 Q4_K_M, Q5_K_M, Q6_K 사용이 권장됩니다.
- 주제
AI 요약
Qwen-Image 2.1의 원본 가중치를 GGUF 형식으로 변환한 배포본입니다. ComfyUI와 ComfyUI-GGUF를 조합해 로컬 환경에서 텍스트-이미지 생성과 이미지 편집을 실행하도록 구성했으며, 변환된 diffusion model뿐 아니라 텍스트 인코더와 VAE도 같은 저장소에서 함께 제공합니다. 모델 파일을 양자화해 GPU 메모리 요구량을 낮추는 구성이 중심입니다.
■ 양자화 파일과 현재 상태
제공하는 diffusion model은 다섯 가지입니다. Q8_0 파일은 7.59GB, Q6_K는 5.88GB, Q5_K_M은 5.22GB, Q4_K_M은 4.60GB, Q4_0은 4.05GB입니다. 저장소는 크기와 품질의 균형이 가장 좋은 선택으로 Q4_K_M을 권장합니다.
다만 현재 qwen-image-2.1-Q8_0.gguf를 ComfyUI에서 샘플링하면 텐서 형태 불일치 오류가 발생합니다. 오류에는 [136]과 [128]이라는 크기가 표시되며, 1D RMSNorm scale quantization 처리와 관련이 있습니다. Q8_0 대신 Q4_K_M, Q5_K_M, Q6_K를 사용하면 별도 수정 없이 동작한다고 안내합니다. Q8_0 수정 파일은 이후 업로드할 예정입니다. Q4_0도 파일 목록에는 포함되어 있지만, 안내문에서 즉시 사용을 검증한 선택지는 Q4_K_M, Q5_K_M, Q6_K입니다.
■ ComfyUI에 필요한 파일
텍스트 인코더는 두 종류입니다. BF16 형식인 qwen3vl_8b_bf16.safetensors는 17.53GB이며, Int8 형식인 qwen3vl_8b_int8_convrot.safetensors는 9.35GB입니다. 낮은 메모리 환경에는 Int8 파일을 권장합니다. VAE는 qwen_image_2.1_vae_bf16.safetensors이며 크기는 676MB입니다.
파일은 ComfyUI/models 아래의 각 디렉터리에 배치합니다. 선택한 GGUF diffusion model은 models/diffusion_models에 넣습니다. 텍스트 인코더는 models/text_encoders에, VAE는 models/vae에 넣습니다. 예를 들어 권장 구성은 diffusion_models/qwen-image-2.1-Q4_K_M.gguf, text_encoders/qwen3vl_8b_int8_convrot.safetensors, vae/qwen_image_2.1_vae_bf16.safetensors입니다.
■ ComfyUI-GGUF 설치와 노드 설정
저장소는 유지 관리 중인 leejet/ComfyUI-GGUF fork를 사용하라고 안내합니다. ComfyUI/custom_nodes 디렉터리에서 git clone https://github.com/leejet/ComfyUI-GGUF 명령으로 설치합니다. 기존 city96/ComfyUI-GGUF에서 Unknown model architecture! 오류가 발생하면 leejet fork로 업데이트해야 합니다. 다른 방법으로는 tools/convert.py에 ModelQwenImage를 추가하는 방안도 제시되어 있습니다.
워크플로에서는 diffusion model에 Unet Loader (GGUF) 노드를 추가하고 내려받은 GGUF 파일을 선택합니다. 텍스트 인코더에는 표준 CLIPLoader 노드를 사용하고 qwen3vl_8b_bf16.safetensors 또는 qwen3vl_8b_int8_convrot.safetensors를 지정합니다. CLIPLoader의 type은 qwen_image로 설정합니다. VAE에는 표준 VAELoader 노드를 추가하고 qwen_image_2.1_vae_bf16.safetensors를 선택합니다.
Comfy-Org가 제공하는 공식 Text-to-Image 또는 Image Edit 워크플로 템플릿도 사용할 수 있습니다. 기존 워크플로에서는 기본 UNETLoader 노드를 Unet Loader (GGUF) 노드로 교체하면 됩니다.
■ GPU와 시스템 RAM 배치
권장 방식은 샘플링 속도에 직접 영향을 주는 GGUF diffusion model을 GPU VRAM에 유지하고, 텍스트 인코더는 시스템 RAM에서 실행하거나 CPU로 오프로딩하는 구성입니다. 텍스트 인코딩은 프롬프트마다 한 번만 실행되므로 텍스트 인코더를 시스템 RAM으로 옮겨도 생성 속도에 미치는 영향이 거의 없다고 설명합니다. 대신 GPU VRAM을 9GB에서 17GB 절약할 수 있습니다.
구체적인 권장 조합은 약 4.6GB를 사용하는 Q4_K_M diffusion model을 VRAM에 배치하고, 약 9.35GB인 Int8 텍스트 인코더를 RAM에서 실행하는 방식입니다. VRAM 부족으로 out-of-memory 오류가 나오면 ComfyUI를 --lowvram 인자와 함께 시작합니다. 텍스트 인코더의 BF16 버전은 17.53GB이므로 메모리 여유가 적은 환경에서는 Int8 버전이 더 적합한 구성으로 제시됩니다.
■ 안전 필터와 모델 출처
이 GGUF 배포본에는 내장 safety checker나 content filter가 없습니다. 프롬프트 거부나 이미지 블랙아웃 없이 성인물, NSFW 이미지, 민감한 이미지를 직접 생성하며, 출력은 입력 프롬프트와 실행 환경에 따라 결정된다고 명시합니다.
기반 모델은 Qwen/Qwen-Image-2.1이며, 텍스트 인코더와 VAE의 출처는 Comfy-Org/Qwen-Image-2.1입니다. 사용한 소스 revision은 b3179ad355be050328e483a9dfdd9e60cd62adfa입니다. GGUF 변환에는 stable-diffusion.cpp commit 1330cebae8f2ba99249df846cc0c9444fcbd4308을 사용했습니다. 배포 라이선스는 Qwen Research License이며 SHA256SUMS 파일로 체크섬을 제공합니다.
원문: Hugging Face / 번역·요약: Trawling