Reddit

Saluki 27B: "96% of Qwen 3.8’s performance at ~1/7 the size"

Saluki 27B: Qwen 3.8 성능의 96%를 7분의 1 크기로

Underdog AI가 Qwen3.8-27B를 7.89GB로 압축한 모델 Saluki를 공개했습니다. 도구 선택과 코딩 에이전트 테스트에서 작은 크기에도 높은 점수를 냈지만, 병렬 도구 호출의 형식 오류와 벤치마크 해석을 둘러싸고 Reddit에서 논쟁이 이어졌습니다.

AI 요약

Underdog AI가 Qwen3.8-27B 기반 2비트 모델 Saluki를 공개했습니다. 원본 모델 파일 약 54GB를 7.89GB로 줄였으며, 별도 빌드 없이 표준 llama.cpp에서 실행합니다. 업체는 16GB 노트북에서도 구동할 수 있고, 도구 선택 성능은 자사 테스트에서 다른 2비트 모델보다 높다고 설명합니다. 이미지를 입력받지는 못하며, 대회 수학 테스트 AIME에서는 원본 점수의 82~85%를 유지한다고 밝혔습니다.

도구 호출 테스트

Underdog Bench는 Berkeley Function Calling Leaderboard에서 고른 120개 과제로 구성합니다. 도구 하나 선택, 여러 도구 중 선택, 도구를 쓰지 않을 상황 판단, 같은 함수의 반복 호출, 여러 함수 호출을 각각 24개씩 평가했습니다. 테스트 과제는 모델을 평가하기 전에 고정했고, 각 모델은 파일에 맞는 자체 실행 환경에서 같은 하네스와 설정으로 실행했습니다.

Saluki는 120개 중 88개를 통과했습니다. 업체의 다른 빌드 Main은 91개, Mia 2-bit는 85개, ISTA 2-bit는 76개, Ternary Bonsai 2는 70개를 통과했습니다. 원본 Qwen3.8-27B는 84개를 통과했습니다. Saluki는 원본이 해결한 84개 가운데 76개를 풀었습니다. 특히 도구 하나를 고르거나 여러 후보 중 적합한 도구를 선택하는 두 항목에서 48개 중 47개를 맞혔습니다. 비교 대상 Mia는 같은 항목에서 31개를 기록했습니다. 업체는 120개라는 표본이 크지 않고 실행 때마다 점수가 달라질 수 있다고 덧붙였습니다.

여러 도구를 한 번에 호출하는 별도 테스트 100개에서는 다른 양상이 나왔습니다. 엄격한 형식 판정에서 Saluki는 42개를 통과했고, 일부 형식 오류를 허용하는 판정에서는 55개를 통과했습니다. Mia는 각각 69개와 70개로 앞섰습니다. Saluki는 23개 과제에서 판독 가능한 호출을 내놓지 못했으며, 업체는 주된 원인으로 출력 형식 오류를 들었습니다. 이 테스트는 thinking을 끈 상태에서 진행했습니다. 원본 모델은 여러 호출이 필요한 과제에서도 호출 하나만 내놓고 멈추는 경우가 있어 35개를 통과했습니다.

코딩·웹 탐색·지시 이행

코딩 에이전트 테스트는 SWE-bench Verified의 실제 GitHub 이슈 50개를 대상으로 합니다. 모델이 코드에서 문제를 찾아 수정하고, 프로젝트 테스트를 통과해야 해결로 인정합니다. Saluki는 30개를 해결해 Ternary Bonsai 2의 29개보다 많았고, 원본 모델의 33개보다는 적었습니다. 원본이 해결한 33개 가운데 Saluki가 해결한 과제는 27개입니다.

WebWalkerQA 웹 탐색 테스트에서는 실제 사이트에서 질문 답을 찾아야 합니다. Saluki는 150개 중 60개를 맞혔고, Ternary Bonsai 2는 55개를 맞혔습니다. 지시 이행 평가 IFEval에서는 Saluki가 느슨한 판정 기준으로 93.5점, 엄격한 기준으로 90.9점을 기록했습니다. 업체는 공개된 원본 점수와 평가 하네스가 다르고 공개 수치가 느슨한 기준인지 불분명하다고 설명했습니다. 끝내지 못한 6개 과제도 오답으로 계산했다고 밝혔습니다.

실행 환경과 한계

Saluki는 llama.cpp 표준 형식을 사용해 기본 llama.cpp와 이를 활용하는 앱에서 실행합니다. 비교 대상 Mia는 ExLlamaV3 형식이라 llama.cpp에서 불러올 수 없습니다. 업체는 각 모델을 해당 파일에 맞는 실행 환경에서 평가했다고 밝혔습니다. Saluki는 복잡한 사고를 켜면 답변 전 충분히 추론하는 편이며, 빠른 도구 호출이 필요하면 thinking을 끄라고 안내합니다. 문자 단위 말장난과 모음 패턴 같은 지시는 약점으로 꼽았습니다.

Reddit 반응

  • @u/chocolateUI — 모델 양자화 담당자들에게 말합니다. 그냥 양자화했다고 부르세요. 가중치를 양자화해 놓고 새 모델을 만든 것처럼 굴면서 엉뚱하고 멋진 이름을 붙이지 마세요.
    • @u/Practical-Collar3063 — 이 모델은 양자화 후 학습을 거쳤을 가능성이 큽니다. 돈과 노력을 들였다면 이름을 바꿔도 괜찮다고 봅니다. 다만 Qwen 3.8 기반이라는 점은 분명히 밝혀야 하는데, 그 점은 밝혔습니다. 다만 그런 추가 학습을 했는지는 설명하지 않았습니다.
  • @u/promethe42 — 파싱 가능한 도구 호출이 55%라니, 너무 낮은 것 아닌가요? 에이전트 작업에서 어떻게 쓸 수 있나요? 제 Qwen3.8 27B Q4는 엄격한 파서에서도 도구 호출이 100% 파싱됩니다. llama.cpp의 제약 생성이 대부분을 해결한다면 왜 제약 없이 얻은 수치를 보고하나요?
    • @u/ummitluyum — 제약 생성을 끈 이유는 양자화 뒤 가중치가 얼마나 손상됐는지 보려는 의도였을 수 있습니다. 2비트로 줄이면 괄호나 따옴표 같은 구조 토큰의 로짓 분포가 무너집니다. 제약 디코딩은 JSON 형식은 맞춰도 의미가 잘못된 인수를 만들어 내는 문제까지 고치지는 않습니다.
  • @u/mtmttuan — 글을 대충 훑어봤는데 마케팅 문구가 많아 보입니다. Underdog Bench 같은 자체 평가 대신 Prism Ternary Quant처럼 표준화된 테스트를 보고 싶습니다.
  • @u/No_Block8640 — Bonsai에 실망한 뒤로 모델을 이렇게 압축하면서도 실제 사용 결과를 유지하는 마법 같은 양자화가 있다고 믿지 않습니다.
    • @u/truthzealot — 저는 Qwen3.8 27B 2bit GSQ RCO를 매일 쓰는데, 할 수 있는 작업이 놀랍습니다.
  • @u/FullstackSensei — 누군가 보정 파이프라인을 공개해 주면 좋겠습니다. 그걸 다른 모델에도 적용해 2~4GB RAM을 쓰는 라즈베리 파이나 2GB 스마트워치에서도 돌릴 수 있게요. 보정 데이터와 전체 파이프라인을 빼고 오픈소스라고 부르기는 어렵습니다.
  • @u/Dany0 — 이 글은 양자화마다 다른 절충점이 생긴다는 점을 잘 보여줍니다. 이 양자화는 한 번의 도구 선택은 잘하지만 여러 단계 호출에는 실패합니다. 다른 양자화는 한 번에 도구를 고르는 능력은 떨어져도 여러 단계 작업은 더 잘합니다. 그래서 FP16이나 네이티브 NVFP4로 학습한 모델이 여전히 강합니다.
  • @u/UsefulIce9600 — Bonsai 2 27B와 비교하면 어떤가요?

원문: Underdog AI / 번역·요약: Trawling