Qwen3.8-Flash-Next용 비균일 GGUF 양자화 — GSQ와 RCO로 텐서별 정밀도 배분

Hugging Face

ISTA-DASLab이 512-expert MoE 모델 Qwen3.8-Flash-Next를 GSQ와 RCO로 비균일 양자화해 2.40·2.50·3.00 bpw GGUF로 공개했습니다. IQ3_XXS는 BF16 대비 4.7배 작으면서 AIME25 점수가 같고, Q2_0은 IQ2_XS보다 프롬프트 처리량이 3.4배 높습니다.