orcarouter/OrcaSAQ-2-27B
OrcaSAQ2 27B: Qwen3.8을 12.3GB로 압축한 에이전트용 모델
OrcaRouter가 Qwen3.8-27B의 BF16 체크포인트를 평균 3.21비트로 양자화해 54GB에서 12.3GB로 줄인 모델을 공개했습니다. 자체 비교에서 perplexity 증가는 0.02%였으며, vLLM 추론과 에이전트 작업 성능 수치도 제시했지만 양자화 기법은 공개하지 않았습니다.
- 주제
AI 요약
OrcaRouter가 Qwen3.8-27B를 평균 3.21비트로 양자화한 OrcaSAQ2 27B를 공개했습니다. BF16 체크포인트 54GB를 12.3GB로 줄여 저장 공간을 77.2% 절감했다고 설명합니다. 모델은 최대 262K 컨텍스트와 thinking mode, tool calling, MTP speculative decoding을 지원하며 vLLM으로 서빙합니다. 다만 모델 가중치만 12.3GB라고 해서 16GB GPU에서 최대 컨텍스트 길이를 모두 활용할 수 있다는 뜻은 아닙니다. KV cache와 vLLM 실행 오버헤드도 메모리를 차지하므로, 제작사는 16GB GPU에서 약 32K 컨텍스트로 시작하라고 안내합니다.
BF16 기준 비교
제작사가 동일한 평가 경로로 BF16 기준 모델과 비교한 결과, perplexity는 5.6468에서 5.6482로 증가했습니다. 상대 변화는 +0.02%이며, 토큰 단위 Top-1 일치율은 93.2%, 평균 KLD는 0.031이라고 보고합니다. 이 수치는 다음 토큰 분포와 예측이 BF16 모델에 얼마나 가까운지 보여주는 지표입니다. 제작사도 perplexity만으로 에이전트 작업 능력을 판단할 수 없다고 설명합니다. 양자화로 달라진 토큰 선택이 도구 호출이나 상태 추적에 영향을 주고, 긴 작업에서는 작은 차이가 누적될 수 있기 때문입니다.
에이전트 평가와 해석
페이지에는 SWE-bench Verified 70.0%, Terminal-Bench 2.1 58.4%가 실려 있습니다. 제작사는 여러 모델의 공개 점수도 함께 제시하지만, 에이전트 스택과 도구, 추론 예산, 제한 시간, 실행 환경이 서로 달라 직접 비교로 해석하면 안 된다고 명시합니다. 따라서 이 수치만으로 다른 모델보다 우수하다고 판단하기보다는 실제 배포 환경에서 같은 하네스와 도구 설정으로 검증해야 합니다. 코딩, 터미널, 브라우저, 컴퓨터 사용, 여러 도구를 잇는 작업을 주요 용도로 제안합니다.
추론 속도와 배포
15.7GiB GPU 메모리 제한에서 측정한 vLLM 결과도 공개했습니다. 단일 스트림에서는 MTP를 끄면 초당 65.3토큰, 켜면 90.1토큰으로 보고해 처리량이 38% 높아졌습니다. 반면 8개 스트림에서는 MTP를 끈 설정이 332토큰/초, 켠 설정이 220토큰/초였고, KV pool도 각각 29,354토큰과 14,563토큰으로 차이가 났습니다. 제작사는 MTP가 추가 연산과 KV 용량을 쓰는 대신 단일 스트림의 대화형 추론 속도를 높인다고 설명하며, 배치가 큰 작업에서는 두 설정을 모두 측정하라고 권합니다.
공개되지 않은 구현 세부사항
OrcaSAQ2는 민감도 기반 혼합 정밀도 양자화 시스템이라고 소개하지만, 정밀도를 배분하는 방법과 보정 데이터, 패킹 기법은 공개하지 않았습니다. 따라서 재현이나 다른 모델에 적용할 수 있는 구체적인 양자화 절차는 페이지에서 확인할 수 없습니다. 체크포인트는 Apache-2.0 라이선스라고 안내하며, 모델은 텍스트 전용이고 비전 타워는 포함하지 않습니다. 사용하려면 OrcaSAQ2용 vLLM 통합이 필요합니다.
배포 방법
페이지는 vLLM과 Hugging Face Hub를 이용한 설치 및 실행 예시를 제공합니다. 실행 설정에는 Qwen3용 reasoning parser와 tool-call parser, qwen3_next_mtp 기반 speculative decoding 구성이 포함됩니다. 최대 길이는 262,144토큰으로 설정할 수 있지만, 실제로 사용할 수 있는 컨텍스트 길이는 GPU 메모리와 KV cache 설정, 배치 크기 등에 따라 달라집니다. 제작사도 실제 서비스의 도구 스키마와 컨텍스트 분포, 추론 예산을 반영해 성능을 측정하라고 안내합니다.
원문: Hugging Face / 번역·요약: Trawling