Cloudflare/clef
Cloudflare Clef, 스키마 기반 멀티모달 의사결정 모델 공개
Cloudflare가 텍스트·JSON·이미지·동영상 상태를 읽고, 사전에 정의한 질문별 선택지의 확률을 한 번의 추론으로 반환하는 27B 모델 Clef를 공개했습니다. 자유 형식 답변을 생성하지 않아 출력 파싱이 필요 없으며, 내부 벤치마크에서는 작업별로 기존 모델과 엇갈리는 성능을 보였습니다.
- 주제
에디터 노트
Clef의 진짜 상대는 벤치마크 표 속 Jev입니다. 둘 다 System One 모델, 즉 문장 대신 상태와 질문 스키마에서 선택지 확률만 뱉는 의사결정 특화형입니다. Jev는 유료 API, Clef는 Apache-2.0 오픈 가중치라 직접 띄울 수 있습니다. 성적도 맞대응입니다. BANKING77 94.2%, CLINC150+OOS 97.4%로 판단 업무는 Clef가 앞서고, GPQA Diamond 78.3% 대 48.0%, MMLU-Pro 82.7% 대 65.9%로 일반 지식은 Jev가 압도합니다. 지연 시간은 Clef 209.3ms로 Jev의 절반 이하입니다. 다만 벤치마크는 Cloudflare 내부 실행 결과입니다. Jev 쪽 평가는 아직 없습니다.
AI 요약
Cloudflare가 정형화한 업무 판단을 수행하는 멀티모달 모델 Clef를 공개했습니다. 입력은 판단 대상인 상태(state)와 질문 스키마입니다. 모델은 텍스트나 JSON뿐 아니라 이미지와 동영상도 읽고, 질문마다 허용된 답변 선택지의 확률을 한 번의 순전파(forward pass)로 반환합니다. 자유 형식 문장을 생성하지 않으므로 응답을 추가로 파싱할 필요가 없습니다.
모델 구조와 실행 방식
Clef는 Qwen/Qwen3.8-27B를 기반으로 후속 학습했으며, 비전 인코더도 포함합니다. 최종 은닉 상태(final hidden states)를 읽는 작은 트랜스포머 헤드가 질문별로 상태의 근거를 연결하고, 모든 질문의 선택지를 함께 점수화합니다. 각 선택지에 로짓(logit)을 출력하며 질문별로 소프트맥스(softmax)를 적용하면 확률을 얻습니다. 가중치는 표준 샤드 형식의 safetensors로 제공하고, 공동 스키마 헤드와 설정 파일, 토크나이저 및 이미지·동영상 처리 설정도 함께 배포합니다.
질문 유형은 세 가지입니다. noul은 참·거짓 판단이며, choice는 이름이 붙은 선택지 가운데 하나를 고르고, score는 순서가 있는 선택지를 대상으로 점수를 매깁니다. 각 질문에는 선택적으로 지시문과 선택지별 기준을 넣을 수 있습니다. 지시문이 없으면 질문 ID를 사용합니다. 입력 길이 기본값은 16,384 토큰이며 max_length와 max_state_tokens로 제한할 수 있습니다. 텍스트 전용 입력과 멀티모달 입력을 한 배치에 섞을 수 있습니다.
API와 배포
Clef API는 Jev 및 SystemOne과 호환됩니다. SystemOne 요청은 모델 이름, 상태, 질문으로 구성하며, 응답에는 질문 ID별 답변과 사용량이 담깁니다. 선택형 답변에는 선택 결과와 신뢰도, 선택지별 확률이 포함됩니다. 점수형 답변은 기대 점수와 신뢰도, 범례, 확률을 반환하고, 참·거짓 질문은 참일 확률을 제공합니다. 이미지 입력은 PIL 이미지로, 동영상은 프레임 배열로 전달합니다. 저장소에는 요청을 인코딩하고 배치를 구성하는 코드와 모델 로더, SystemOne 함수가 포함됩니다. 안내된 테스트 환경은 torch 2.11, transformers 5.10.2, 단일 H200이며 이미지·동영상에는 Pillow도 필요합니다. 라이선스는 Apache-2.0입니다. 더 작고 빠른 변형 모델 Clef-Flash도 함께 안내합니다.
공개된 평가 결과
Cloudflare가 공개한 Decision Index 0.2.1 내부 실행 결과에서 Clef는 작업에 따라 강점이 달랐습니다. BANKING77 매크로 F1은 94.2%, CLINC150+OOS는 97.4%, BPoMP 정확도는 96.9%였습니다. 반면 GPQA Diamond 정확도는 48.0%로 Jev의 78.3%보다 낮았고, MMLU-Pro에서도 Clef는 65.9%, Jev는 82.7%였습니다. 일부 항목에서는 Clef-Flash가 앞섰습니다. 예를 들어 홈 어플라이언스 시뮬레이터 정확도는 Clef 83.0%, Clef-Flash 97.7%였고, ContractNLI 매크로 F1도 각각 81.4%, 84.3%였습니다.
지연 시간 표에서 Clef의 중앙값은 209.3ms, 95백분위수는 238.6ms입니다. Clef-Flash는 각각 38.8ms와 122.4ms로 더 짧았습니다. 다만 Clef-Flash의 95백분위수는 중앙값보다 크게 늘어납니다. 별도로 Typesafe Evals의 네 가지 업무 흐름에서는 합의 참조 라벨을 기준으로 평가했습니다. 송장 처리의 정확한 전체 작업 일치율은 Clef 64.7%, Clef-Flash 57.1%, Jev 61.8%였습니다. 고객 서비스는 세 모델이 76.0~77.0%로 비슷했고, 보안 사고 처리는 Clef가 62.9%로 Jev와 Clef-Flash의 61.7%보다 조금 높았습니다. 에이전트 추적 관측성에서는 Jev가 주요 작업 기준 71.6%로 Clef의 68.5%보다 높았습니다. 결과는 업무별로 달라지므로 단일 점수만으로 모델 간 우열을 정하기보다 실제 질문 스키마와 업무 데이터에 맞춰 확인해야 합니다.
원문: Hugging Face / 번역·요약: Trawling