ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF
Swift 1.5 Qwen3.8-27B 혼합 정밀도 GGUF 양자화 모델 공개
UkisAI가 Swift 1.5 Qwen3.8-27B를 네 가지 혼합 정밀도 GGUF로 양자화해 공개했습니다. Swift에 맞춘 GSQ 개선으로 시작 양자화보다 7개 평가 영역의 KL 발산이 모두 낮아졌지만, 일부 ISTA 비교 모델보다 수치가 높으며 긴 컨텍스트 성능은 검증하지 않았습니다.
- 주제
AI 요약
UkisAI가 Swift 1.5 Qwen3.8-27B의 혼합 정밀도 GGUF 파일 네 가지를 공개했습니다. 각 파일은 ISTA-DASLab의 GSQ-RCO 공개 자료에서 같은 Qwen3.8-27B 등급에 사용한 텐서별 비트 할당을 재사용하고, Swift 1.5 가중치와 중요도 행렬을 바탕으로 추가 개선했습니다. 새 Swift용 RCO 탐색을 수행한 것은 아닙니다.
모델과 양자화 구성
Swift 1.5는 Swift 1.0을 바탕으로 긴 작업, 에이전트형 작업, 코딩 작업에 맞춘 사후 학습을 거쳤습니다. 모델 카드에 따르면 기본 모델보다 사고 토큰을 58.5% 적게 쓰면서 점수는 0.35% 높였고, 여러 작업에서 9.18배 속도를 기록했습니다. 이 수치는 모델 수준 비교이며, 이번 GGUF 양자화 평가와는 별개입니다.
공개 파일은 IQ2_XS, IQ2_S, IQ3_XXS, IQ3_S 네 등급입니다. 파일 크기는 각각 8.42GB, 9.26GB, 10.09GB, 11.77GB입니다. MTP(Multi-Token Prediction) 헤드를 포함한 파일도 별도로 제공하며, 크기는 등급별로 0.35GB 더 큽니다. MTP 파일은 해당 모델 구현을 지원하는 실행 환경이 필요합니다. 측정한 품질 수치는 일반 파일 기준이며 MTP 디코딩 속도와 품질은 따로 평가하지 않았습니다. 등급명은 모든 텐서에 같은 양자화 형식을 적용했다는 뜻이 아니라 혼합 정밀도 할당 프로필을 가리킵니다.
평가 결과와 한계
양자화에 따른 분포 차이는 KL 발산(KLD)으로 측정했습니다. Swift 1.5 BF16 모델의 다음 토큰 분포를 기준으로 삼으며, 수치가 낮을수록 차이가 작습니다. 개발 측정은 wiki.test.raw의 100개 청크를 문맥 길이 512로 평가했습니다. 이 데이터는 양자화 개선 과정에 쓰였으므로 독립 검증 결과가 아닙니다.
별도 보류 평가에서는 C4 산문, CodeParrot 코드, GSM8K 수학 텍스트를 각각 100개 청크로 측정했습니다. 독일어, 프랑스어, 스페인어, 중국어 텍스트는 mC4에서 언어별 25개 청크를 사용했습니다. 모든 측정의 문맥 길이는 512입니다. 네 파일 모두 일곱 영역에서 대응하는 Swift 시작 양자화보다 KLD가 낮았습니다. 다만 이 결과는 다음 토큰 분포의 차이를 나타낼 뿐, 작업 정확도나 수학 벤치마크 점수는 아닙니다.
ISTA 비교 양자화 결과와 비교하면 모든 항목에서 앞서지는 않습니다. 수학 텍스트 KLD는 4.9~7.7% 높았고, IQ3_S는 일곱 영역 중 다섯 영역에서 더 높은 수치를 보였습니다. ISTA 비교군은 각자 대응하는 BF16 모델을 기준으로 측정했으므로 Swift와 Qwen의 작업 성능을 직접 비교하거나 두 모델의 능력이 동등하다는 근거로 볼 수 없습니다. 평가 길이는 512토큰이며 32K 이상 문맥에서의 품질도 확인하지 않았습니다. 보정·개발 텍스트와의 어휘 중복 검사를 했지만 의미 수준 중복 제거 또는 과적합 부재를 입증하는 검사는 아닙니다.
생성 절차와 실행
제작 과정은 공개된 ISTA 텐서별 할당을 대응 등급에 적용하고, Swift V1MIX 중요도 행렬로 가중치를 양자화한 뒤 Swift 전용 GSQ 개선을 수행하는 순서입니다. IQ2_XS와 IQ3_XXS에는 고정 목적함수 변형을, IQ2_S와 IQ3_S에는 보존된 V1MIX 변형을 적용했습니다. 정확한 파일 식별 정보는 release-manifest.json과 SHA256SUMS에 기록했고, 텐서별 할당 정보도 모델 해시와 텐서 수, 형식 분포를 포함해 공개했습니다.
실행에는 Qwen3.8을 지원하는 llama.cpp 빌드가 필요합니다. 저장소는 비공개 상태이므로 접근 권한이 있는 계정으로 인증해야 합니다. 예시 명령은 IQ3_XXS 파일을 내려받아 llama-server로 실행하며, 컨텍스트 크기는 사용 가능한 메모리에 맞춰야 합니다. 예시에 제시한 262144 컨텍스트는 해당 양자화 모델을 그 길이로 평가했다는 뜻이 아닙니다. 이번 공개에는 언어 모델 GGUF만 포함됐으며 Swift 27B 비전 프로젝터는 검증되지 않아 제공하지 않습니다.
가중치는 Swift Open License v1.0에 따라 배포합니다. 원본 Qwen 구성 요소에는 Apache 2.0과 NOTICE가 적용됩니다. GSQ와 RCO는 오스트리아 과학기술연구소(ISTA)의 Deep Algorithms and Systems Lab이 개발했으며, 이번 Swift 적용은 UkisAI가 진행했습니다.
원문: Hugging Face / 번역·요약: Trawling