orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
Qwen3.8-Flash-Next 비검열 GGUF 모델 공개
Qwen3.8-Flash-Next의 거부 응답 성향을 제거한 모델을 GGUF로 변환해 2~8비트 양자화 파일로 제공합니다. llama.cpp에서 CPU·GPU 추론과 이미지 입력을 지원하며, 별도 MTP 초안 모델을 이용한 추측 디코딩도 안내합니다. 유해 요청 거부율이 기준 모델의 64~100%에서 약 0~3.3%로 낮아졌다고 보고합니다.
- 주제
AI 요약
OrcaRouter가 Qwen3.8-Flash-Next의 거부 방향(refusal direction)을 제거한 모델을 GGUF 형식으로 변환해 공개했습니다. 이른바 abliteration은 residual stream에서 거부와 관련한 방향을 직교화해 안전성 정렬을 크게 약화하는 방식입니다. 게시자는 이 모델이 원본이 거부할 유해하거나 불법적인 요청에도 응답한다고 명시하며, 해석 가능성 연구와 안전성 평가, 레드팀 작업 등 정당한 연구 목적에 한정하라고 안내합니다. 배포나 활용 과정에서는 별도 안전 필터를 마련해야 한다고 덧붙입니다.
모델 구조와 실행 환경
모델은 512개 전문가 중 토큰마다 라우팅 전문가 10개와 공유 전문가 1개를 활성화하는 Mixture-of-Experts(MoE) 구조입니다. 게시물은 Gated DeltaNet 선형 어텐션, 마이크로블록 단위의 Qwen Sparse Attention(QSA), 레이어 정규화 대신 쓰는 HyperConnections, PLE n-gram 해시 임베딩을 주요 구성으로 소개합니다. 비전·언어 입력과 추론, 도구 호출도 지원합니다.
파일은 2비트부터 8비트까지 제공하며, 기본 선택으로 Q4_K_M을 권합니다. 크기는 약 110GB입니다. 가장 작은 Q2_K는 약 74GB지만 품질 저하가 눈에 띌 수 있고, Q8_0은 약 188GB입니다. 영어·중국어·코드 보정 텍스트로 중요도 행렬을 계산한 IQ 계열도 제공하며, 게시자는 저비트에서 일반 K-quant보다 비트당 품질이 낫다고 설명합니다. 이미지 입력에는 약 0.9GB의 별도 mmproj 파일이 필요합니다.
llama.cpp와 추측 디코딩
qwen4_exp 아키텍처 지원은 llama.cpp에 병합됐으며, 게시물은 해당 변경이 반영된 최신 빌드를 사용하라고 안내합니다. 오래된 런타임은 아키텍처를 인식하지 못할 수 있습니다. 일반 실행은 GGUF 파일을 llama-cli에 지정하고, 이미지 입력에는 --mmproj를 추가합니다. 도구 호출에는 Qwen 템플릿을 적용하는 --jinja 옵션을 사용합니다.
추측 디코딩에는 두 가지 방법을 제시합니다. 일반 양자화 파일은 약 4GB인 MTP-draft 파일과 짝지어 -md 옵션으로 실행합니다. 게시자는 이 방식에서 디코딩 속도가 약 1.3~2배, 초안 수락률이 약 67%였다고 보고합니다. Q8_0-MTP 파일은 초안 헤드를 내장해 별도 파일 없이 실행하지만, 아직 특정 llama.cpp 변경사항이 필요한 별도 빌드에서만 동작한다고 설명합니다.
용량과 품질 관련 참고
Q6_K 이상에서는 PLE 임베딩 테이블이 별도 Q8_0 텐서로 저장됩니다. 이 텐서는 약 54GB로 단일 요청 다운로드 제한보다 커서 Xet 또는 범위 요청을 지원하는 다운로드 도구가 필요합니다. 48GB를 넘는 GGUF는 여러 파일로 분할하며, 첫 번째 조각을 지정하면 나머지를 함께 불러옵니다. 게시자는 저비트 양자화에서 품질 저하가 커지고, 특히 Q2_K와 IQ2에서 두드러진다고 안내합니다.
게시자가 보고한 평가
vLLM에서 원본 Qwen3.8-Flash-Next와 같은 스크립트로 비교한 결과, 유해 프롬프트 거부율은 원본의 64~100%에서 약 0~3.3%로 낮아졌다고 합니다. 무해한 요청에 대한 과잉 거부는 거의 0%로 유지됐고, MMLU-Pro·GSM8K·CMMLU 계열 평가의 성능은 원본 대비 ±2점 안에 들었다고 보고합니다. 비전 입력과 다중 턴 도구 호출도 작동을 확인했다고 밝혔습니다.
원문: Hugging Face / 번역·요약: Trawling