Viggle/Qwen-Image-2.1-viggle-turbo
Viggle, Qwen-Image-2.1을 6단계로 구동하는 Turbo LoRA 공개
Viggle이 Qwen-Image-2.1을 바탕으로 텍스트-이미지 생성과 이미지 편집을 지원하는 증류 모델을 공개했습니다. 40단계 대신 6단계로 생성하며, 자체 평가에서 기본 모델과 구도 차이가 없고 다양성은 0.98배였지만 복잡한 편집과 작은 글자 표현은 여전히 열세입니다.
- 주제
AI 요약
Viggle이 Qwen-Image-2.1을 바탕으로 만든 이미지 생성·편집 모델 Qwen-Image-2.1-viggle-turbo를 공개했습니다. Distribution Matching Distillation(DMD) 계열 방식으로 기본 모델의 출력을 적은 단계로 재현하도록 학습했습니다. 텍스트로 이미지를 생성하거나 최대 3장의 참조 이미지를 활용해 지시 기반 편집을 수행합니다. 기본 모델이 40단계를 쓰는 데 비해 Turbo는 6단계를 사용하며, 안내를 위한 classifier-free guidance(CFG)는 쓰지 않습니다. 제작진은 전체 생성 과정이 약 5배 빠르다고 설명합니다.
v0.2.1 성능과 평가
현재 권장 버전은 v0.2.1입니다. 기본 모델과 같은 프롬프트, 입력 이미지, 난수 시드를 사용해 비교한 예시 32개에서는 대부분 결과 차이를 구분하기 어려웠다고 합니다. 가장 분명한 차이는 작고 빽빽한 글자 표현으로, 기본 모델이 더 잘 처리합니다. 해당 예시에서는 8단계를 쓰면 글자가 6단계보다 선명해집니다. 여러 조건을 한꺼번에 지시하는 편집, 여러 참조 이미지를 섞는 작업, 얼굴 교체와 인물 정체성 유지에서도 기본 모델에 못 미칠 수 있습니다.
96개 사용자 요청으로 비교한 자체 평가에서는 v0.2.1의 이미지 다양성이 기본 모델 대비 0.98배였습니다. 이는 프롬프트별 8개 시드의 DINOv2 패치 거리로 다양성을 측정한 값입니다. 같은 프롬프트와 시드에서 이미지 중심점이 이동한 정도는 평균 +0.000으로, 기본 모델과 구도 차이가 없다고 보고했습니다. 구도가 눈에 띄게 달라진 프롬프트 비율도 0%였습니다. 다만 이 지표는 제작진이 만든 평가이며 표준 벤치마크 결과는 아닙니다. 2K 출력은 수치 평가 대신 눈으로 비교했고, 비교 결과도 기본 모델 예시를 기준으로 했습니다.
학습 방식과 버전 차이
v0.2.1은 같은 학습 실행에서 700번째 단계의 체크포인트입니다. 이전 v0.2는 600번째 단계입니다. 두 버전은 학습 절차와 6단계 스케줄이 같으며, v0.2.1의 Laplacian 선명도는 0.0199로 v0.2의 0.0187보다 높습니다. 다양성은 각각 기본 모델의 0.98배와 0.97배이며, 구도 차이는 두 버전 모두 0%입니다.
배포 모델은 기본 Transformer 전체를 교체하는 대신 LoRA 어댑터를 실행 중 불러옵니다. 권장 파일은 rank 256, alpha 256, bf16 형식의 1.3GB 어댑터입니다. 680MB인 rank 128 버전도 제공하며, rank 256 업데이트를 SVD로 줄였을 때 레이어별 에너지의 중앙값 95%를 유지한다고 설명합니다. 두 어댑터를 동시에 적용하거나, LoRA를 병합해 쓰지 말라고 안내합니다. bf16 가중치에 병합하면 업데이트가 손실될 수 있기 때문입니다.
실행 설정과 ComfyUI
Diffusers 실행 예제는 Qwen-Image-2.1 기본 모델에 LoRA를 불러온 뒤 6단계와 시그마 값 [1.0, 0.9375, 0.875, 0.75, 0.5, 0.25]를 지정합니다. 해당 파이프라인은 아직 정식 배포된 Diffusers 버전에 포함되지 않아 저장소 커밋을 지정해 설치해야 합니다. 프롬프트 개선에는 Qwen의 공식 프롬프트 재작성기를 권장합니다. 모델이 개선된 프롬프트를 기준으로 학습됐기 때문입니다.
저장소에는 ComfyUI용 커스텀 노드와 텍스트-이미지 생성·편집 워크플로도 포함합니다. LoRA를 가중치에 병합하는 기본 로더와 달리 전용 노드는 실행 중 LoRA를 적용합니다. 제작진의 5개 요청 비교에서 이 방식은 기본 모델과의 LPIPS 차이를 줄였습니다. 다만 단계당 처리 시간은 약 10~25% 늘어납니다. ComfyUI 통합은 제작진이 일상적으로 쓰는 환경이 아니며, AI 코딩 보조 도구로 대부분 작성했다고 밝힙니다. 시그마 스케줄과 Diffusers 실행 결과는 확인했지만, 덜 흔한 설정에서는 문제가 남을 수 있습니다.
사용 조건
이 모델은 Qwen-Image-2.1의 파생물이며 Qwen RESEARCH LICENSE AGREEMENT를 따릅니다. 연구와 평가 목적의 비상업적 사용만 허용하며, 상업적 이용에는 별도 라이선스가 필요합니다.
원문: Hugging Face / 번역·요약: Trawling