fastino/GLiNER2.5-Decide
GLiNER2.5-Decide: 한 번의 추론으로 여러 업무 분류
Fastino가 운영 업무 분류에 맞춘 3억 4천만 개 매개변수 모델 GLiNER2.5-Decide를 공개했습니다. 실행 시점에 라벨을 지정하고 한 번의 추론으로 여러 분류 결과를 얻으며, 공개 벤치마크에서 평균 정확도 60.2%를 기록했습니다.
- 주제
AI 요약
GLiNER2.5-Decide는 정해진 라벨 가운데 적절한 항목을 고르는 영어 분류 모델입니다. 의도, 담당 팀, 긴급도, 정책 위반 여부처럼 운영 시스템에서 필요한 결정을 분류하도록 설계했습니다. 프롬프트 템플릿이나 생성 토큰 없이 입력 텍스트와 호출 시 지정한 라벨을 비교합니다. 범용 질의응답이나 추론, 설명 생성용 모델은 아닙니다.
호출 시 라벨을 정합니다
gliner2를 설치한 뒤 AutoExtractor.from_pretrained("fastino/GLiNER2.5-Decide")로 불러오고 classify_text를 호출합니다. 모델에 분류 체계를 미리 고정하지 않아도 됩니다. 환불 요청, 항공 예약 변경, 진료 예약, 문서 종류, 스팸 여부처럼 작업별 라벨을 호출할 때 전달합니다. 라벨 이름만으로 구분이 모호하면 각 라벨에 설명을 붙여 분류 기준을 구체화합니다.
한 번의 호출에 의도, 긴급도, 담당 팀 등 여러 분류 항목을 함께 넣을 수 있습니다. 각 항목은 같은 입력을 바탕으로 결과를 내므로, 여러 작업을 처리하려고 모델을 반복 실행하지 않아도 됩니다. 단일 라벨 분류는 가장 적합한 문자열 하나를 반환합니다. 다중 라벨 분류는 지정한 임계값을 넘는 라벨을 모두 반환하며, 예시에서는 cls_threshold를 0.4로 설정합니다. 순위가 필요한 업무는 0부터 5 또는 0부터 10까지 숫자를 문자열 라벨로 넘겨 분류하는 방식으로 처리합니다.
운영 업무의 예시
모델 카드에는 고객 문의를 환불·취소·로그인 문제로 나누는 사례부터 금융 문의 라우팅, 항공권 변경, 병원 예약, 직원 지원 티켓 배정까지 다양한 예시가 실려 있습니다. 한 메시지에서 의도와 긴급도, 담당 팀을 함께 예측하거나, 호텔 고객의 요청에서 객실 변경과 우선순위, 설비·결제 주제를 동시에 분류하는 구성도 보여줍니다. 리뷰에서는 전체 감정을 혼합으로 분류하면서 배터리·키보드·화면처럼 언급된 측면을 여러 개 추출합니다. 이 결과는 업무 큐 배정이나 후속 자동화의 입력으로 쓰는 형태입니다.
그 밖에 지문 내용에 관한 예·아니오 질문, 책 장르 분류, 만족도 점수 예측도 예시로 제시합니다. 다만 자유 형식 답변이나 설명을 생성하는 기능은 범위에 포함되지 않습니다. 모델은 DeBERTa-v3-large 인코더를 바탕으로 하며 매개변수는 3억 4천만 개입니다. gliner2 라이브러리를 사용하고 CPU와 GPU에서 실행할 수 있으며, 라이선스는 Apache 2.0입니다.
공개 벤치마크
Fastino가 제시한 fast-decisions 평가는 17개 도메인에서 도메인마다 검증용 사례 300개를 사용합니다. 모델마다 같은 텍스트와 후보 라벨을 제공하고 정확 일치율을 비교했으며, GLiNER2.5-Decide의 평균 점수는 60.2%입니다. 비교 대상은 GLiNER2.5-Decide-1B 59.6%, JevK5 57.6%, GLiNER2.5-multi-Decide 56.7%, SemIf(Qwen3.5-4B) 56.4%, GLiFormer large-v1 49.0%, Laya Router 46.6%입니다. 이 수치는 해당 영어 평가 세트의 결과이며, 모델 카드도 평가 언어가 영어라고 명시합니다. 다국어 입력에는 GLiNER2.5-multi-Decide를 사용하라고 안내합니다.
원문: Hugging Face / 번역·요약: Trawling