inclusionAI/Ming-Image-0.1-Design
Ming-Image-0.1-Design — 텍스트가 많은 시각 콘텐츠 생성 모델
Ming-Image-0.1-Design은 UI, 인포그래픽, 포스터처럼 글자가 많은 디자인을 만드는 6B 텍스트-이미지 모델입니다. 투명 배경 RGBA 출력도 지원하며, 권장 설정은 2048×2048 해상도와 12회 샘플링입니다.
- 주제
AI 요약
Ming-Image-0.1-Design은 UI, 인포그래픽, 포스터 등 텍스트가 포함된 시각 디자인 제작을 겨냥한 6B 텍스트-이미지 모델입니다. 이미지 전체 구성을 생성하며, 투명 배경을 적용한 RGBA 출력도 지원합니다.
설치 및 추론
동반 저장소인 Ming-Image를 복제하고 의존성을 설치한 뒤 infer.py에서 모델과 프롬프트 파일을 지정해 실행합니다. 추론 프레임워크로는 vLLM-Omni를 권장합니다. 프롬프트 개선(Prompt Enhancement)에는 Ling-3.0-flash-VL 또는 qwen3.8-27B를 사용할 수 있습니다.
권장 설정과 제약
권장 해상도는 2048×2048이며, 더 빠른 생성을 원하면 1024×1024를 선택합니다. 샘플링 단계는 12, CFG scale은 1.0, 정밀도는 BF16입니다. 검증한 구성에는 VRAM 80GiB CUDA GPU 한 대가 필요합니다. 공개 추론 코드는 요청한 해상도를 지원되는 1024 또는 2048 버킷에 맞춥니다. 투명 배경 미리보기의 체크무늬는 실제 RGBA 이미지에 포함되지 않습니다. 모델은 MIT License로 공개했습니다.
원문: Hugging Face / 번역·요약: Trawling