Hugging Face

ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF

Qwen3.8-Flash-Next 압축 모델 — 코딩·에이전트 작업에 맞춘 전문가 가지치기

ISTA-DASLab이 Qwen3.8-Flash-Next의 전문가 512개 중 절반을 제거하고, 남은 가중치를 3.5 bpw로 양자화한 GGUF 모델을 공개했습니다. 전체 파일은 58.4GB지만 메모리에 상주해야 하는 변환기 가중치는 29.6GB이며, LiveCodeBench v6 점수는 원본의 98.7%를 유지했습니다.

AI 요약

ISTA-DASLab이 코드 작성, 에이전트 도구 사용, 비전, 공간 추론을 겨냥해 Qwen3.8-Flash-Next를 압축한 GGUF 모델을 공개했습니다. 원본은 1769억 개 매개변수를 갖고 BF16 형식에서 354GB를 차지합니다. 새 모델은 각 계층의 전문가 512개 가운데 256개를 제거하고, 남은 가중치를 3.5 bpw로 저장합니다. 변환기 전체 매개변수 기준으로 계산한 유효 저장률은 1.89비트입니다. 이 수치는 가지치기와 양자화 효과를 원본 매개변수 수에 나눠 반영한 값이며, 개별 가중치를 1.89비트로 저장한다는 뜻은 아닙니다.

파일 크기와 메모리 사용량

모델 파일 두 개의 합계는 58.4GB입니다. 이 가운데 변환기 가중치 파일은 29.6GB로 메모리에 상주해야 합니다. 나머지 28.8GB는 계층별 n-gram 조회 테이블이며 디스크에서 제공할 수 있습니다. n-gram 테이블은 행렬 곱셈에 쓰는 가중치가 아니므로 4.5 bpw로 고정 저장하고, 가지치기와 양자화 탐색에서는 제외했습니다. 따라서 변환기 작업 집합은 32GB 가속기 한 대의 메모리 용량 안에 들어갑니다. llama.cpp는 두 파일을 함께 불러오며, 저장소 안내에는 모델 파일을 내려받고 llama-cli로 실행하는 명령도 포함되어 있습니다.

전문가 제거 방식

Flash-Next는 48개 계층마다 전문가 512개와 라우터를 둡니다. 토큰마다 활성화하는 전문가는 10개입니다. 전문가가 전체 매개변수의 대부분을 차지하므로, 전문가 제거는 특정 시점에 실행되는 연산량만 줄이는 방식과 다릅니다. 모델에서 매개변수 자체를 없애 파일 크기와 상주 메모리를 모두 줄이고, 라우터가 고를 후보도 줄입니다. 양자화는 매개변수를 유지하면서 저장 정밀도를 낮추므로 두 방법을 함께 적용했습니다.

어떤 전문가를 남길지는 보정 데이터에 따라 달라집니다. 전문가는 입력 분포에 따라 서로 다른 능력을 지원하므로, 중요도를 입력 분포와 무관한 고정값으로 정하기 어렵습니다. 연구진은 경험적 중요도 순위 대신 RCO를 사용해 보정 데이터에서 가지치기 모델과 원본 모델 사이의 KL 발산을 줄이도록 전문가를 선택했습니다.

GGUF는 모델 전체에 전문가 수를 하나만 기록합니다. 따라서 모든 계층에서 같은 수의 전문가를 유지해야 합니다. 계층별로 다른 수를 남기는 전역 예산 방식이 더 나은 결과를 낼 수도 있지만, GGUF 형식에서 이를 표현하려면 패딩이 필요해 절약한 메모리를 잃게 됩니다. 연구진은 계층마다 정확한 예산 제약을 둬 형식의 조건을 직접 반영했습니다. RCO의 제약 투영과 복원 단계는 계층별로 나뉘어 처리되지만, 최적화 목표인 전체 모델의 KL 발산은 계층을 함께 고려합니다. 그러므로 예산 집행은 계층별로 하면서도 계층별 전문가 선택은 공동으로 최적화합니다. 계층마다 별도 벌점 계수를 조정할 필요도 없습니다.

보정 데이터와 평가 결과

초기 탐색에는 코드와 에이전트 작업 데이터만 넣었습니다. 그러자 비전 경로에 필요한 전문가가 제거돼 이미지 처리 능력이 크게 떨어졌고 코딩 점수는 영향을 받지 않았습니다. 연구진은 이를 보정 데이터가 측정하지 않는 능력을 탐색이 보존하지 않은 결과로 설명합니다. 공개 모델에서는 비전 데이터를 보정 혼합에 추가해 해당 능력을 유지하도록 했습니다.

모든 점수는 xhigh 추론 설정에서 측정했습니다. SWE-bench Verified 점수는 BF16 원본의 82.80에서 75.60으로 내려가 원본 점수의 91.3%를 유지했습니다. 실제 저장소에서 여러 단계에 걸쳐 작업하는 에이전트 능력을 평가하는 벤치마크입니다. LiveCodeBench v6 점수는 87.43에서 86.28로, 원본의 98.7%를 유지했습니다. 연구진은 여러 차례의 상호작용을 이어가는 작업에서는 단계마다 오차가 쌓일 수 있어, 단일 코드 문제보다 용량 축소의 영향을 더 크게 받을 수 있다고 설명합니다. 비전·코드 보정 혼합에 포함되지 않은 능력은 추가 검증이 필요하다고 안내합니다.

관련 도구와 사용 조건

압축에는 DASLab이 개발한 GSQ와 RCO를 사용했습니다. GSQ는 낮은 비트 폭에서 격자 할당과 그룹 스케일을 함께 학습하는 사후 학습 스칼라 양자화 기법입니다. RCO는 리만 다양체에서 정확한 예산 제약을 다루는 최적화 기법이며, 이번 모델에서는 계층별 전문가 제거 예산을 맞추는 데 쓰였습니다. 모델 가중치는 기반 모델 Qwen3.8-Flash-Next의 라이선스를 따릅니다. 게시물은 Strata라는 외부 실행 엔진을 이용해 8GB VRAM의 단일 NVIDIA GPU에서 구동했다는 사용자 보고도 언급합니다.

원문: Hugging Face / 번역·요약: Trawling