Qwen/Qwen-Image-2.1
Qwen-Image-2.1 — 투명 이미지를 지원하는 통합 텍스트·이미지 생성 및 편집 모델
Qwen-Image-2.1은 Qwen 계열의 오픈소스 통합 이미지 생성·편집 모델입니다. 시각 생성 구성 요소에 7B 파라미터와 32개 Single-Stream DiT 레이어를 사용하며, 텍스트 생성, 이미지 편집, RGBA 투명 이미지 생성, 최대 10개 참조 이미지 활용을 지원합니다.
- 주제
AI 요약
Qwen-Image-2.1은 Qwen 계열에서 공개한 통합 텍스트-이미지 생성(text-to-image generation) 및 이미지 편집(image editing) 모델입니다. 시각 생성 구성 요소는 70억 개(7B) 파라미터 규모이며, 32개의 Single-Stream DiT 레이어로 구성되어 있습니다. 공개 설명은 이 모델이 이미지 품질, 추론 효율성(inference efficiency), 활용 범위(versatility)의 균형을 목표로 한다고 소개합니다. ModelScope, Hugging Face, Blog, Demo, Discord 경로가 함께 제공되며, 모델은 Qwen Research License Agreement에 따라 사용할 수 있습니다.
■ 경량 구조와 추론 효율
Qwen-Image-2.1의 첫 번째 개선점은 Compact and Efficient 구조입니다. 모델은 mixed-granularity attention을 사용하고 prefix KV cache reuse를 적용해 계산 비용을 낮추면서 이미지 품질을 유지하도록 구성되어 있습니다. 원문은 이 조합을 통해 가벼운 아키텍처에서 강한 이미지 품질을 제공한다고 설명합니다. 설치에는 PyTorch 2.4.0 이상, Transformers 5.17 이상, GitHub 저장소의 Diffusers, Accelerate, Pillow가 필요합니다. 예시 환경에서는 `torch_dtype=torch.bfloat16`을 지정하고 `QwenImage21Pipeline`을 불러온 뒤 CUDA 장치로 이동합니다.
■ 텍스트에서 이미지와 투명 이미지까지 통합
기본 텍스트-이미지 생성은 프롬프트를 `pipe`에 전달하는 방식으로 실행합니다. 예시에서는 “QWEN IMAGE 2.1”이라는 문구가 적힌 네온 상점 간판을 비 오는 밤과 젖은 노면의 반사 효과가 있는 장면으로 생성하도록 요청합니다. 출력 크기는 2048×2048, 추론 단계 수는 40으로 설정하며, CUDA용 난수 생성기에 시드 42를 지정해 실행 결과를 재현할 수 있도록 합니다. 생성된 결과는 `t2i_example.png` 파일로 저장합니다.
투명 이미지 생성도 동일한 파이프라인에서 지원합니다. 원문은 RGBA 이미지임을 명시하고, 알파 채널(alpha channel)과 투명한 배경을 포함한다고 설명하는 권장 프롬프트 형식을 제시합니다. 예시 프롬프트는 귀여운 만화풍 드래곤 스티커를 만들도록 요청하며, 역시 2048×2048 크기와 40회의 추론 단계를 사용합니다. 이렇게 생성한 결과는 `transparent_example.png`로 저장합니다. 따라서 일반적인 불투명 이미지뿐 아니라 투명 배경이 필요한 스티커나 레이어형 결과를 하나의 모델에서 다루는 구성을 제공합니다.
■ 이미지 편집과 참조 이미지 활용
이미지 편집에서는 Pillow로 `input.png`를 읽고, 입력 이미지를 `image` 인자로 파이프라인에 전달합니다. 예시 프롬프트는 기존 이미지의 배경을 석양이 비치는 해변으로 바꾸도록 요청하며, 결과는 `edit_example.png`에 저장합니다. 공개 설명에 따르면 모델은 최대 10개의 참조 이미지를 사용할 수 있습니다. 또한 원형 표시, 직접 그린 주석, 별도 마스크를 이용해 이미지의 특정 영역을 지정하는 편집을 지원합니다. 사람과 제품을 편집할 때 정체성(identity)을 보존하는 기능도 개선 사항으로 제시합니다.
이 기능 구성은 전체 이미지를 새로 생성하는 작업과 기존 이미지의 일부를 바꾸는 작업을 같은 모델과 파이프라인에서 처리하도록 설계되어 있습니다. 원문은 여섯 개의 인물 참조 이미지를 사용한 그룹 사진 생성, 텍스트 렌더링, 투명 이미지 생성 사례를 주요 기능 예시로 제시합니다. 다만 각 사례의 세부 프롬프트나 정량 평가 결과는 공개 본문에 포함되어 있지 않습니다.
■ 텍스트 표현과 세부 묘사
네 번째 개선점은 Realistic Textures and Refined Aesthetics입니다. Qwen-Image-2.1은 타이포그래피(typography), 인물 조명(portrait lighting), 미세한 디테일(fine details)을 개선해 보다 설득력 있는 시각 결과를 제공하도록 구성되었습니다. 특히 텍스트가 포함된 이미지 생성과 인물 표현, 질감이 중요한 장면을 개선 대상으로 설명하고 있습니다. 원문은 실제 모델 출력의 품질을 소개하지만, 벤치마크 점수나 기존 버전과의 수치 비교는 제시하지 않습니다.
■ 실행 설정과 지원 해상도
기본 예시는 `QwenImage21Pipeline.from_pretrained("Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16)`로 모델을 불러옵니다. CUDA 환경에서는 `.to("cuda")`를 사용하고, 메모리 사용 방식에 따라 `enable_model_cpu_offload()`를 활성화할 수 있습니다. 오프로드 예시는 파이프라인을 먼저 불러온 뒤 CPU 오프로드를 켜는 형태로 제공됩니다.
지원 종횡비와 권장 해상도는 1:1의 2048×2048, 4:3의 2400×1792, 3:4의 1792×2400, 3:2의 2528×1696, 2:3의 1696×2528, 16:9의 2752×1536, 9:16의 1536×2752입니다. 다양한 가로·세로 비율을 별도 설정값으로 제공하므로 정사각형 이미지뿐 아니라 가로형과 세로형 결과도 같은 파이프라인에서 생성할 수 있습니다. Hugging Face 페이지에 표시된 지난달 다운로드 수는 183회입니다.
원문: Hugging Face / 번역·요약: Trawling