Language models for text classification: From bag-of-words to Jev
텍스트 분류 언어 모델의 역사 — BoW부터 Jev까지
Sebastian Raschka가 단어 빈도 기반 분류기부터 신경망과 트랜스포머를 거쳐 Jev에 이르는 텍스트 분류의 흐름을 정리합니다. Jev는 IMDb 테스트에서 정확도 96%대를 기록했으며, 저자는 넓은 작업 범위와 빠르고 저렴한 추론을 강점으로 꼽습니다. 다만 내부 구조와 학습법은 공개되지 않았습니다.
- 주제
AI 요약
Jev는 텍스트를 분류하고 선택하는 작업에 특화된 모델로 소개되며, 다양한 분류 작업을 별도 미세 조정 없이 처리하면서 대형 언어 모델보다 빠르고 저렴하다는 점으로 관심을 모았습니다. Sebastian Raschka는 Jev의 성능을 기존 분류 기법의 역사와 비교하고, 공개된 정보가 제한적인 만큼 내부 구조와 학습 방식에 관한 설명은 추정과 확인된 사실을 구분해 다룹니다.
단어 빈도에서 신경망까지
트랜스포머 이전에는 문서의 단어를 세어 고정 길이 벡터로 만드는 bag-of-words(BoW)가 널리 쓰였습니다. Naive Bayes, 로지스틱 회귀, SVM, XGBoost 같은 분류기에 이 벡터를 넣으면 스팸 메일처럼 특정 단어가 강한 단서가 되는 작업을 저렴하게 처리할 수 있습니다. 반면 단어 순서를 잃기 때문에 “개가 사람을 문다”와 “사람이 개를 문다”를 구별하지 못할 수 있습니다. 저자는 간단하고 구현하기 쉬운 BoW와 로지스틱 회귀를 여전히 텍스트 분류의 기본선으로 권합니다.
단어 임베딩을 쓰는 CNN과 RNN은 순서 정보를 반영합니다. RNN은 단어를 차례로 읽으며 은닉 상태를 갱신하고, LSTM과 GRU는 정보를 유지하고 갱신하는 게이트를 추가합니다. CNN은 인접 단어 묶음에 필터를 적용하며 위치별 계산을 병렬화할 수 있습니다. 저자가 제시한 IMDb 영화 리뷰 실험에서는 BoW와 로지스틱 회귀가 정확도 89.9%, LSTM이 85.66%, CNN이 약 90.07%를 기록했습니다. 사전 학습 후 미세 조정하는 ULMFiT는 95.4%에 도달했습니다.
트랜스포머를 분류기로 쓰기
BERT 같은 인코더 모델은 분류 토큰 표현에 분류 헤드를 붙여 미세 조정할 수 있습니다. 저자는 ModernBERT가 IMDb에서 약 95% 정확도를 보였다고 설명합니다. GPT 같은 디코더 모델도 프롬프트만으로 분류하거나, 출력층을 분류 헤드로 바꿔 학습할 수 있습니다. T5처럼 인코더와 디코더를 결합한 모델은 분류 헤드를 붙이거나 클래스 이름을 출력하도록 학습할 수 있습니다. 이 방식들은 작업에 맞춘 학습이나 프롬프트 설계가 필요하며, 큰 모델을 단순 분류에 쓰면 비용과 속도 면에서 과할 수 있습니다.
Jev의 API와 IMDb 실험
Jev는 여러 작업에서 별도 미세 조정 없이 작동하는 범용 분류 모델로 소개됩니다. Choice API는 정해진 선택지 중 하나를 고르고 확률과 confidence를 반환합니다. Noul API는 질문에 대한 참일 확률을 내놓아 여러 라벨을 각각 독립적으로 평가할 수 있습니다. Score API는 기준표에 맞춰 점수를 매깁니다. 글은 이메일 분류뿐 아니라 게임 Tetris의 다음 행동 선택 사례도 들며, 이를 분류 모델의 활용 범위가 넓다는 사례로 제시합니다.
저자가 IMDb 테스트 세트 2만 5천 건에 Choice API를 적용한 결과 정확도는 96.47%(24,117건 정답), 처리 시간은 22분 24초, 입력 토큰은 약 1,546만 개, 비용은 0.6492달러였습니다. Noul API는 정확도 96.20%(24,050건 정답), 23분 3초, 약 1,511만 입력 토큰, 0.6345달러를 기록했습니다. 같은 테스트 세트에서 Choice를 다시 실행했을 때 결과가 달라질 만큼 추론은 완전히 결정적이지 않았습니다. 저자는 테스트 데이터가 학습에 포함됐는지 알 수 없다는 점도 덧붙입니다. ModernBERT는 학습 세트 미세 조정에 23분, 테스트 평가에 7분이 걸렸습니다. 특정 작업에서 대량으로 쓰고 속도와 정확도를 최대로 끌어올리려면 전용 모델 미세 조정이 여전히 합리적이라는 설명입니다.
가능한 구현 방식과 학습 추정
Jev의 아키텍처, 알고리즘, 학습 데이터는 공개되지 않았습니다. 저자는 낮은 지연 시간을 근거로 ModernBERT와 비슷한 작은 모델일 가능성을 추측하지만, 확인된 사실로 제시하지는 않습니다. 창업자는 학습 데이터가 전부 합성 데이터라고 밝혔고, 저자는 성능의 상당 부분이 데이터 선별에 달렸을 가능성을 듭니다. Jev의 학습법으로 공개된 이름은 Reinforcement Learning for Calibrated Decisions(RLCD)이지만, 구체적인 방식은 알려져 있지 않습니다.
글은 관련 아이디어로 2025년 논문이 제안한 Reinforcement Learning with Calibration Rewards(RLCR)를 설명합니다. 일반적인 강화학습 보상에 답의 정확도뿐 아니라 자신감 추정의 정확성도 반영하는 방식입니다. HotpotQA에서 RLCR은 RLVR보다 기대 보정 오차(ECE)를 0.37에서 0.03으로 낮췄고, 정확도는 62.1% 대 63.0%로 비슷했습니다. 여섯 데이터셋 평균에서는 ECE가 0.46에서 0.21로 낮아지고 정확도는 53.9%에서 56.2%로 올랐습니다. 다만 저자는 Jev의 RLCD와 RLCR 사이에 공식적으로 확인된 연관성은 없다고 선을 긋습니다.
보정(calibration)은 모델이 74%라고 예측한 사례 가운데 실제로 약 74%가 맞도록 확률값을 조정하는 작업입니다. temperature scaling은 로짓을 온도 값으로 나눈 뒤 확률을 계산하며, 이 값은 별도 검증 데이터에서 학습합니다. 저자는 분류 헤드에 후보 설명을 하나씩 넣고 같은 점수화 헤드로 점수를 매기면, 후보 수가 달라져도 모델 구조를 바꾸지 않는 Jev 유사 API를 만들 수 있다고 설명합니다. 하지만 API 모양을 구현하는 일과 서로 다른 작업에서 잘 작동하도록 학습하는 일은 별개입니다.
어디에 쓰이고 무엇이 남았나
Jev는 매번 전용 분류기를 미세 조정하기 번거롭지만 대형 LLM 호출 비용도 줄이고 싶은 경우에 적합하다고 저자는 봅니다. 에이전트 시스템에서는 프롬프트 인젝션 사전 검사, 추론 노력 수준 선택, 스킬 선택, 평가, 문맥 구성에 쓸 수 있습니다. 빠르게 만들어진 Jev 유사 모델은 IMDb 성능이나 Tetris 같은 다양한 작업에서 Jev에 미치지 못한 사례가 소개됩니다. 저자는 개방형 대안이 필요한 이유로 비용보다 개인정보 보호를 듭니다. 전용 모델의 성능과 데이터 통제 요구가 큰 환경에서는 자체 미세 조정이 여전히 선택지로 남습니다.
Hacker News 반응
- @nzoschke — 좋은 글입니다. “2022년 ChatGPT가 온갖 글을 생성하는 범용 대화 모델이라 흥미로웠듯, Jev는 각 작업마다 분류기를 미세 조정하지 않고도 다양한 텍스트를 저렴하게 분류하는 ‘분류의 ChatGPT 순간’이라는 설명이 제 생각과 맞습니다. 이메일 분류 전략을 비교하고 있는데 Jev가 유망해 보입니다. 몇 가지 전략을 여기서 비교했습니다: https://housecat.com/blog/classifying-email”
- @tomrod — Raschka 박사는 훌륭합니다. 좋은 글입니다.
원문: Ahead of AI / 번역·요약: Trawling