AtomicChat/Qwen-Image-2.1-Turbo-Uncensored-GGUF
Qwen-Image 2.1 Turbo용 거부 제거 인코더 공개 — 이미지 생성 결과는 달라지지 않아
AtomicChat이 Qwen-Image의 텍스트 인코더에서 채팅 거부 방향을 제거한 GGUF 모델과 평가 결과를 공개했습니다. 채팅 모델의 거부율은 크게 낮아졌지만, 45개 민감 프롬프트 테스트에서는 기존 이미지 생성 결과와 달라진 항목이 없었습니다.
- 주제
AI 요약
AtomicChat이 Qwen-Image 2.1 Turbo용 텍스트 인코더 Qwen3-VL-8B-Instruct를 편집한 GGUF 파일을 공개했습니다. 편집 대상은 이미지 모델 전체가 아니라 텍스트 인코더의 거부 방향입니다. 제작자는 이 파일을 stable-diffusion.cpp의 --llm 인자로 사용하며, 같은 인코더를 이미지 입력을 처리하는 mmproj와 함께 llama.cpp에서도 채팅 모델로 실행할 수 있다고 설명합니다.
무엇을 바꿨나
Qwen-Image는 텍스트 인코더, 7B 디노이저, VAE 등으로 이미지를 생성합니다. AtomicChat에 따르면 공개 가중치 파이프라인에는 안전성 검사기가 없고, 디노이저도 거부 기능을 갖추지 않았습니다. Qwen의 호스팅 서비스에는 별도 검열이 있지만, 공개 가중치에서는 그 필터가 작동하지 않는다고 설명합니다.
편집한 부분은 텍스트 인코더입니다. 채팅 모델로 쓸 때 Qwen3-VL-8B-Instruct가 거부에 활용하는 방향을 잔차 표현에서 제거했습니다. 구체적으로 유해 요청 416개와 무해 요청 416개를 사용해 마지막 프롬프트 토큰의 잔차 스트림에서 방향을 추정한 뒤, 36개 어텐션 출력 행렬과 36개 MLP 다운 프로젝션, 토큰 임베딩에 W' = W - 0.75 r rᵀW 편집을 적용했습니다. 비전 타워는 수정하지 않았습니다. 제작자는 검증 프롬프트로 26가지 편집 변형을 비교했으며, 공개된 측정치는 별도의 테스트 프롬프트에서 얻었다고 밝혔습니다.
채팅 평가 결과
영어 JBB 유해 행동 프롬프트 81개에서 원본 모델의 거부율은 88.9%였고, 편집 모델은 1.2%였습니다. 러시아어 Aya 레드팀 프롬프트 100개에서는 38%에서 0%로 내려갔습니다. 안전한 XSTest 프롬프트 250개에 대한 거부율은 2.0%에서 0%로 바뀌었습니다. 거부 여부는 답변 첫머리를 기준으로 판정했으므로, 답변처럼 보이는 완곡한 거부를 놓칠 수 있다고 제작자는 덧붙였습니다.
MMLU 2,000문항 점수는 편집 전후 모두 77.35%였습니다. 양쪽 모델에서 답변이 바뀐 문항은 각각 15개였고, McNemar 검정의 p값은 1.0이었습니다. 도구 호출 20회는 모두 유효했고, 3만 토큰 문맥의 Needle 테스트도 세 구간 모두 통과했습니다. 무해한 텍스트에서 원본과 편집 모델 사이의 평균 KLD는 0.0018이었습니다.
이미지 생성 측정
이미지 평가는 민감 프롬프트 45개와 중립 프롬프트 48개를 대상으로 했습니다. 같은 시드와 디노이저를 사용해 원본 인코더와 편집 인코더의 결과를 비교했으며, 민감 프롬프트 가운데 이미지 판정기가 요청된 내용을 확인한 비율은 두 모델 모두 40/45였습니다. 누드·선정적 표현, 폭력·무기·약물, 이미지 속 욕설·의학 해부, 흡연·음주·문신 등의 항목에서도 측정된 비율은 같았습니다. 45개 프롬프트 중 어느 것도 결과가 바뀌지 않았습니다.
LPIPS 기준 이미지 차이는 민감 프롬프트에서 0.088, 중립 프롬프트에서 0.084였습니다. 새 시드를 썼을 때의 차이는 0.499였고, 원본 인코더를 Q8_0으로 양자화했을 때는 0.037이었습니다. 따라서 이 테스트에서는 편집이 거부 대상 이미지를 새로 생성하게 만들지 않았고, 민감·중립 프롬프트 모두에서 일반적인 이미지 변화만 관측됐습니다. 다만 제작자도 테스트가 프롬프트 45개와 단일 시드에 한정되며, 이미지 판정기에 의존한다고 밝혔습니다.
GGUF 파일과 재현 조건
저장소는 BF16 16.39GB부터 Q2_K 3.34GB까지 여러 양자화 파일을 제공합니다. BF16 파일의 중립 프롬프트 LPIPS는 0이며, Q8_0은 0.031, AD-Q4_K는 0.087, AD-Q2_K는 0.241입니다. 채팅 모델 기준으로는 Q8_0의 원본 대비 KLD가 0.0029이고 top-1 토큰 일치율은 98.04%입니다. AD-Q4_K는 KLD 0.0154, top-1 일치율 95.30%입니다. 제작자는 용량이 허용되면 Q8_0을, 4비트 모델이 필요하면 AD-Q4_K를 권합니다.
양자화 방식도 이미지 결과에 영향을 줬습니다. 일반 llama-quantize의 Q4_K_M은 5.03GB이며 BF16 결과와의 LPIPS가 0.166이었습니다. 반면 260MB 더 큰 AD-Q4_K는 0.087을 기록했습니다. AD 레이아웃은 어텐션 키·값을 비교적 높은 정밀도로 유지하고, 일부 어텐션·MLP 가중치와 토큰 임베딩에도 높은 비트를 배정합니다. 중요도 행렬은 특수 토큰을 파싱한 채팅 형식 보정 데이터 2,000개 청크로 만들었습니다.
이미지 테스트는 stable-diffusion.cpp 커밋 36f1b1a와 A100 80GB에서 진행했습니다. 해상도는 1024×1024이며 Turbo 디노이저는 BF16, 시드는 42였습니다. 인코더 편집은 BF16 가중치에 F32로 적용한 뒤 한 차례 반올림했고, GGUF 파일은 llama.cpp 커밋 6184e92를 기반으로 만들었습니다. 제작자는 ComfyUI, Mac, 비-Turbo Qwen-Image-2.1 디노이저에서는 아직 시험하지 않았다고 밝혔습니다. 편집 인코더가 거부를 덜 하더라도 결과물의 안전성·정확성·적법성을 보장하지 않으므로, 배포 환경에서 별도의 접근 제어와 정책 집행이 필요하다고 안내합니다.
원문: Hugging Face / 번역·요약: Trawling