Infatoshi/GLM-5.3-UNCENSORED-EXL3-3.0bpw
GLM-5.3 무검열판 EXL3 양자화 모델 공개
Infatoshi가 GLM-5.3의 가중치를 편집한 무검열판을 EXL3 3.0bpw로 양자화해 공개했습니다. 8장의 A100 40GB에서 TabbyAPI로 구동했고, 모델 카드에는 양자화 품질 평가와 도구 호출 시 주의할 파서 동작을 기록했습니다.
- 주제
AI 요약
Infatoshi가 공개한 모델은 dealignai/GLM-5.3-UNCENSORED-FP8을 EXL3 형식으로 양자화한 체크포인트입니다. 상위 모델은 zai-org/GLM-5.3의 가중치를 편집한 변형이며, 파인튜닝 모델은 아닙니다. 가중치 편집 내용은 원본 저장소에서 복사한 CRACK_SURGERY.json에 기록돼 있습니다. 게시자는 dealignai나 Z.ai와 제휴 관계가 없다고 밝혔습니다.
모델 구성과 양자화
전체 파라미터는 753B입니다. 256개 라우팅 전문가 중 토큰마다 8개를 활성화하고, 공유 전문가 1개를 추가로 둡니다. 모델은 MLA 어텐션과 DSA 희소 인덱서, 78개 레이어와 MTP(next-token prediction) 레이어로 구성됩니다.
평균 양자화 비트율은 3.04bpw입니다. 변환 옵션은 -b 3.0 --hq를 사용했습니다. 어텐션과 공유 전문가는 5bpw, 밀집 MLP는 4bpw, 라우팅 전문가는 3bpw로 양자화했습니다. lm_head는 6bpw이며 mul1 코드북을 씁니다. 체크포인트 크기는 273GiB입니다.
MTP 레이어도 포함합니다. 이 레이어는 보정하지 않았으며, 전문가를 4bpw로, 어텐션과 공유 전문가를 6bpw로 저장했습니다. TabbyAPI에서 draft_mode: mtp를 지정하면 speculative decoding의 초안 모델로 쓸 수 있습니다.
품질 평가
변환에는 ExLlamaV3 커밋 d3739fd를 사용했습니다. FP8 체크포인트를 직접 읽어 기본 보정 설정인 250행, 행당 2048토큰으로 변환했습니다. wikitext-2 테스트 세트 20행으로 비교한 결과, 양자화 모델과 FP8 모델 사이의 KL divergence는 각각 0.089와 0.097입니다. 토큰별 KL 중앙값은 0.021, 90백분위수는 0.221입니다. Perplexity는 양자화 모델 3.440, FP8 모델 3.302였습니다. FP8 모델의 최상위 토큰 확률이 0.95 이상인 토큰은 전체의 44%였고, 그 구간에서 KL 중앙값은 0.0011입니다.
tau2-bench의 airline과 retail 작업도 측정했습니다. 비교 기준은 무검열 편집 전의 기본 GLM-5.3 FP8 모델이며, Z.ai가 OpenRouter를 통해 제공한 모델을 같은 평가 하네스에서 실행했습니다. 따라서 결과 차이에는 dealignai의 가중치 편집과 이번 양자화가 함께 반영됩니다.
airline 100회 평가에서 기준 모델의 성공률은 0.710 ± 0.045, 양자화 모델은 0.640 ± 0.048이었습니다. 차이는 -0.070으로 약 1.1 표준오차입니다. retail에서는 기준 모델이 0.504 ± 0.033, 양자화 모델이 0.482 ± 0.047로 차이는 -0.022, 약 0.4 표준오차였습니다. 표본 규모가 작아 어느 차이도 통계적으로 유의하지 않습니다. 게시자는 airline 결과의 낮은 점수를 측정된 퇴행으로 단정하지 말고 작은 회귀 가능성으로 보라고 덧붙였습니다. 기준 모델은 airline 50개 작업을 2회, retail 114개 작업을 2회 실행했고, 양자화 모델은 각각 2회와 1회 실행했습니다.
실행 환경과 도구 호출 주의점
테스트는 A100 40GB 8장으로 구성한 서버에서 TabbyAPI를 사용했습니다. 자동 GPU 분할을 적용했고, MTP 초안 생성과 98K 토큰 공유 캐시를 켰습니다. 설정의 max_seq_len은 65536, cache_size는 98304입니다. 도구 형식은 glm4_7, 추론 기능은 활성화했습니다.
도구 호출에는 파서 주의사항이 있습니다. GLM은 도구 인자를 <arg_value>9523456873</arg_value>처럼 일반 텍스트로 출력합니다. TabbyAPI의 glm4_5 파서는 도구 스키마를 확인하지 않고 모든 값을 JSON으로 디코딩합니다. 주문번호나 우편번호처럼 문자열이어야 할 값이 숫자로 보이면 정수로 바뀝니다. 게시자는 이 문제로 tau2-bench retail 도구 호출의 약 70%가 실패했다고 설명합니다. 문자열 타입으로 선언된 인자는 파서가 원문 그대로 유지하도록 수정해야 합니다. 위 벤치마크는 이 수정을 적용한 뒤 실행했습니다.
저장소에는 config.json의 quantization_config.bits가 정수여야 한다는 설정 경고도 표시됩니다. 라이선스는 상위 GLM-5.3 및 dealignai 공개본을 따르는 MIT입니다.
원문: Hugging Face / 번역·요약: Trawling