Hugging Face

Contrastive-LM/CLM-v0.1-8B

CLM-v0.1-8B — 상태와 행동을 비교 학습하는 의사결정 모델

Contrastive-LM은 Qwen3-8B 인코더를 고정하고 상태·행동 프로젝션 헤드만 학습한 8B 모델입니다. 후보를 생성하는 대신 주어진 후보를 점수화하며, 상태와 행동 임베딩을 캐싱해 다수 후보를 빠르게 평가합니다.

AI 요약

Contrastive Language Model(CLΜ)은 상태와 행동을 연결하는 대조 학습(contrastive learning) 방식의 System One 모델입니다. CLM-8B는 Qwen3-8B 인코더를 고정한 뒤 상태 헤드와 행동 헤드라는 두 개의 작은 프로젝션 헤드를 얹고, 양방향 InfoNCE 손실 함수로 학습합니다. 텍스트를 생성하는 언어 모델과 달리 사용자가 준 후보를 비교하고 점수를 매기는 데 초점을 둡니다.

학습 데이터와 평가

학습은 세 단계로 진행합니다. 약 6천만 개의 Nemotron 질의응답 쌍으로 사전 학습하고, 약 3천만 개의 합성 하드 네거티브(synthetic hard negatives)로 중간 학습한 뒤, 약 100만 개의 에이전트 궤적(agentic trajectories)으로 후처리합니다. 모델 카드에 따르면 제로샷 컴퓨터 사용, 게임, 도구 호출 작업에서 Jev와 비슷한 수준을 보이며 지연 시간은 최대 9배 낮습니다.

검증기(verifier)로 미세 조정한 헤드는 DeepSWE에서 81.6%, Terminal-Bench 2.1에서 87.6%를 기록했고, Jev보다 4~6배 빠르다고 설명합니다. 이 벤치마크 수치는 공개된 기본 체크포인트의 제로샷 성능이 아니라 미세 조정한 헤드의 결과입니다.

후보 점수화와 캐싱

CLM은 고객 문의의 긴급도, 담당 부서, 불만 수준처럼 정해진 기준에 따른 질문을 처리하거나, 자유 형식 후보의 순위를 매길 수 있습니다. 예를 들어 원인 후보 가운데 조석을 달의 중력으로 설명한 답을 선택하는 식입니다. 출력 확률은 입력한 후보 집합 안에서 상대적으로 계산합니다. 후보를 새로 생성하지 않으므로, 평가할 문항과 후보를 호출하는 쪽에서 준비해야 합니다.

상태와 행동을 각각 인코딩해 행동 임베딩을 재사용하는 상태·행동 캐싱(State & Action Caching)도 지원합니다. 후보가 약 1천 개일 때 Jev보다 13배 빠르다고 모델 카드는 밝힙니다. 다만 임베딩 인코더로 Qwen3-8B의 마지막 토큰 풀링(last-token-pooled) 결과를 요구하므로 인코더를 임의로 바꿀 수는 없습니다.

실행과 미세 조정

pip install contrastive-lm으로 설치한 뒤 vLLM에서 Qwen/Qwen3-8B를 임베딩 모델로 서비스하고 clm-serve를 실행합니다. 기본 API 주소는 http://127.0.0.1:8700이며, 웹 플레이그라운드도 함께 제공합니다. 미세 조정에서는 인코더 전체가 아니라 헤드만 학습하므로 상대적으로 적은 비용으로 작업별 검증기를 만들도록 설계했습니다. DeepSWE와 Terminal-Bench용 헤드 및 미세 조정 스크립트도 안내합니다.

공개 가중치는 Apache 2.0 라이선스입니다. 모델 카드에는 더 많은 데이터와 연산량, 파라미터를 사용하는 멀티모달 CLM-35B를 10월 초 공개할 예정이라고 적혀 있습니다.

원문: Hugging Face / 번역·요약: Trawling