OrcaSAQ2 27B: Qwen3.8을 12.3GB로 압축한 에이전트용 모델
OrcaRouter가 Qwen3.8-27B의 BF16 체크포인트를 평균 3.21비트로 양자화해 54GB에서 12.3GB로 줄인 모델을 공개했습니다. 자체 비교에서 perplexity 증가는 0.02%였으며, vLLM 추론과 에이전트 작업 성능 수치도 제시했지만 양자화 기법은 공개하지 않았습니다.
OrcaRouter가 Qwen3.8-27B의 BF16 체크포인트를 평균 3.21비트로 양자화해 54GB에서 12.3GB로 줄인 모델을 공개했습니다. 자체 비교에서 perplexity 증가는 0.02%였으며, vLLM 추론과 에이전트 작업 성능 수치도 제시했지만 양자화 기법은 공개하지 않았습니다.