Hugging Face

prism-ml/Ternary-Bonsai-2-27B-gguf

Ternary Bonsai 2 27B — 5.95GB에 담은 27B 추론 모델

Prism ML이 Qwen3.8-27B를 삼진 가중치로 변환한 27B 모델을 공개했습니다. GGUF 파일은 5.95GB이며, 자체 평가에서 FP16 기준 점수의 98.2%를 기록했습니다. llama.cpp 포크의 전용 커널이 필요합니다.

AI 요약

Prism ML이 Qwen3.8-27B 기반 추론 모델 Ternary Bonsai 2 27B를 공개했습니다. 가중치를 −1, 0, +1 세 값으로 표현해 언어 모델 파일 크기를 5.95GB로 줄였습니다. 제작진은 FP16 모델보다 약 9배 작으면서 추론 성능을 대부분 유지한다고 설명합니다. 이 모델은 Apache 2.0 라이선스로 공개됐습니다.

삼진 가중치와 저장 방식

각 가중치 그룹 128개에 FP16 스케일 하나를 공유합니다. 행렬에는 블록 단위 Hadamard 회전을 적용하고, 추론 때 활성값에도 대응하는 변환을 적용합니다. 회전은 저장된 가중치에 반영하므로 추가 저장 공간이나 가중치 데이터 이동은 들지 않습니다. 임베딩, 어텐션·MLP 투영층, LM head까지 삼진 표현을 적용했으며, 전체 평균은 가중치당 1.72비트입니다. 일부 정규화 가중치와 선형 어텐션의 recurrent state 경로는 고정밀도로 남깁니다.

GGUF 패킹은 두 종류입니다. PTQ1_0은 삼진 값을 조밀하게 저장해 1.75비트와 5.95GB를 기록하고, PQ2_0은 값을 2비트 슬롯에 넣어 2.13비트와 7.21GB를 차지합니다. PQ2_0은 압축 해제가 단순하고, PTQ1_0은 메모리 사용량을 줄입니다. 어느 쪽이 빠른지는 GPU에 따라 다릅니다.

벤치마크와 실행 성능

제작진이 NVIDIA H100에서 EvalScope와 vLLM으로 14개 벤치마크를 평가한 결과, Bonsai 2 27B는 평균 84.78점을 얻었습니다. FP16 기준 모델은 86.32점, UD-Q4_K_XL은 85.18점, IQ2_XXS는 72.59점입니다. 파일 크기는 각각 약 54GB, 17.6GB, 7.27GB이며 Bonsai 모델은 5.95GB입니다. IQ2_XXS보다 12점 이상 높은 점수를 기록했고, 세 배가량 큰 UD-Q4_K_XL과의 차이는 0.4점입니다.

세부 항목에서는 수학 점수가 FP16의 97.06점에서 96.57점으로, 코딩 점수는 89.07점에서 89.42점으로 나왔습니다. 반면 지식·추론 항목은 85.55점에서 79.86점, 비전 항목은 71.36점에서 66.19점으로 낮아졌습니다. IQ2_XXS는 AIME26에서 57.50점, LiveCodeBench에서 56.40점이었고, Bonsai 모델은 각각 95.83점과 90.07점을 기록했습니다. 다만 이 수치는 제작진이 제시한 자체 평가 결과입니다.

성능 측정에서 PQ2_0은 RTX 5090의 생성 속도 129.9토큰/초, H100의 113.9토큰/초를 기록했습니다. PTQ1_0은 RTX 4090에서 91.1토큰/초로 PQ2_0의 81.2토큰/초보다 빨랐습니다. 이 모델의 저장 공간 이점이 모든 GPU에서 지연 시간 감소로 이어지지는 않습니다. 밀집 삼진 값을 풀어내는 연산 부담이 있어, 메모리 대역폭이 병목인 Ada 세대 GPU와 L4에서는 PTQ1_0이 유리하지만 H100·A100·Blackwell에서는 PQ2_0이 더 빠릅니다.

Apple Silicon에서는 M5 Pro 측정값이 생성 28.1토큰/초입니다. M5 Max의 47토큰/초 수치는 회전 적용 전 빌드에서 측정했고, 제작진은 현재 스택으로 다시 측정할 예정이라고 밝혔습니다. 모델은 Qwen3.8-27B의 하이브리드 어텐션 구조를 이어받아 최대 262K 토큰 문맥을 지원합니다. 다만 실제 사용량은 실행 환경과 설정에 따라 달라집니다.

실행 시 주의점

일반 llama.cpp는 이 파일 형식을 지원하지 않습니다. PTQ1_0과 PQ2_0을 인식하지 못하며, Q2_0으로 잘못 읽으면 Hadamard 활성값 변환이 빠져 출력이 손상될 수 있습니다. Prism ML의 llama.cpp 포크와 전용 커널을 사용해야 합니다. 저장소에는 CUDA·Metal·CPU 백엔드가 명시돼 있으며, 이미지 입력에는 별도로 제공되는 Q8_0 비전 타워 파일이 필요합니다. 실행 예시와 하드웨어별 설정은 제작진이 관리하는 Bonsai-demo 저장소를 기준으로 안내합니다.

원문: Hugging Face / 번역·요약: Trawling