Hugging Face

audnai/penclaw-GLM-5.3-abliterated

audnai/penclaw-GLM-5.3-abliterated — 거부 동작을 가중치 편집으로 제거한 Warlock

Audn이 공개한 Warlock은 추가 학습 없이 모델의 거부 동작을 가중치 수준에서 제거한 GLM 계열 언어 모델입니다. Audn Refusal Benchmark에서 비거부율 92.5%, 실제 사용 가능한 응답 생성률 82.5%를 기록했으며, Transformers·vLLM·sglang에서 실행할 수 있습니다.

AI 요약

Warlock은 Audn이 제작한 abliterated language model로, 모델이 특정 요청을 거부하도록 만드는 내부 방향을 가중치 편집으로 제거한 모델입니다. 제작 설명에 따르면 이 과정에는 fine-tuning이나 retraining이 전혀 들어가지 않으며, 모델의 residual stream에 값을 기록하는 가중치를 계층별로 수정합니다. 따라서 일반적인 추가 학습 모델이나 런타임 프롬프트 기반 우회 방식과 달리, 편집된 가중치를 그대로 배포하고 표준 모델과 같은 방식으로 로드·서빙하는 구조입니다.

■ 가중치 수준의 abliteration

Abliteration은 모델 내부에서 거부 여부를 결정하는 데 사용되는 방향(direction)을 분리한 뒤, residual-writing weight에서 해당 방향을 투영해 제거하는 방식입니다. 설명상 나머지 네트워크는 변경하지 않으므로 reasoning, knowledge, fluency와 같은 기존 능력과 응답의 일관성을 유지하면서, 이전에는 거부하던 요청에도 답하도록 만드는 것이 목표입니다. 이 저장소의 모델은 BF16(bfloat16) 텐서와 Safetensors 형식으로 제공되며, 별도의 adapter나 runtime prompt, 추가 scaffolding 없이 사용할 수 있습니다.

■ Audn Refusal Benchmark 결과

평가는 thinking-on 설정, temperature 1.0, 16k-token budget으로 진행했으며, 응답이 단순히 거부하지 않았는지만이 아니라 실제로 사용 가능한 내용을 전달했는지를 LLM judge가 판정했습니다. Warlock은 Non-refusal 92.5%, Delivery 82.5%를 기록했습니다. 여기서 Non-refusal은 모델이 거부하지 않은 프롬프트의 비율이고, Delivery는 완전하고 사용할 수 있는 답변을 생성한 비율입니다. 즉 두 지표는 거부 회피와 실제 응답 전달을 구분해 측정합니다.

전체 결과를 여러 judge backend 기준으로 비교하면, Warlock의 Regex comply는 92.5%입니다. 비교 대상으로 제시된 necromicon standard는 96.7%(503/520), KIMI-K3-1M은 97.1%(505/520)였습니다. 반면 objectionable request에 실질적인 내용을 전달한 DELIVERED 비율은 Warlock이 82.5%로, necromicon standard의 65.0%(338건)와 KIMI-K3-1M의 76.7%(399건)보다 높았습니다. 안전한 대체 답변이나 재구성, 비실행 가능한 답변으로 분류된 DEFLECTED는 Warlock 10.0%로 집계됐고, 두 비교 모델은 각각 19.6%(102건), 17.5%(91건)였습니다. 실질적인 거부인 REFUSED는 Warlock 7.5%로, necromicon standard의 15.0%(78건)와 KIMI-K3-1M의 5.8%(30건) 사이에 해당합니다. Regex 기준 빈 응답은 Warlock에서 0건이었습니다.

■ 이전 반복 실험과 실행 조건

추가 표에는 iter4와 iter11의 결과도 제시되어 있습니다. Arditi substring 기준 Non-refusal은 iter4에서 70%, iter11에서 85%였고, necromicon judge 기준 Delivery는 각각 37.5%와 35.0%였습니다. Coherence는 두 반복 모두 intact로 기록됐으며, iter11에서는 약 8/40개가 borderline으로 표시됐습니다. Verdict breakdown은 iter4가 delivered 15건, deflected 14건, refused 11건이고, iter11은 delivered 14건, deflected 24건, refused 2건입니다. 프로젝트 설명에서는 iter4를 first coherent span baseline, iter11을 best coherent result로 구분합니다.

Warlock은 thinking model이므로 답변 전에 긴 reasoning을 수행합니다. 문서에서는 생성 예산을 최소 16k tokens 이상으로 설정하라고 안내하며, 예산이 작으면 reasoning block 안에서 출력이 잘려 최종 답변이 짧아질 수 있다고 설명합니다. Transformers, vLLM, sglang에서 로드할 수 있으며, Transformers 예시에서는 `AutoTokenizer.from_pretrained("audnai/penclaw-GLM-5.3-abliterated", trust_remote_code=True)`로 토크나이저를 불러오고, `AutoModelForCausalLM.from_pretrained`에 `dtype="bfloat16"`, `device_map="auto"`, `trust_remote_code=True`를 지정합니다.

■ 제공 및 사용 범위

모델은 Hugging Face에서 제공되며, 지난달 다운로드 수는 670으로 표시되어 있습니다. Audn은 Warlock을 자사와 파트너의 authorized red-team, safety-research, evaluation 용도로 의도한다고 밝히고 있으며, 사용자가 관련 규정을 준수할 책임이 있다고 명시합니다. 또한 audn.ai/audncode CLI와 함께 사용하는 것을 권장하고, Audn API를 유료로 제공한다고 안내합니다. 이 모델의 핵심은 별도의 미세 조정 없이 거부 동작에 관여한다고 설명된 가중치 방향을 직접 편집했다는 점과, 그 결과를 비거부율과 실제 전달률이라는 두 지표로 제시했다는 점입니다.

원문: Hugging Face / 번역·요약: Trawling