Hugging Face

SupersonicLabs/Julia-1

Julia 1 — 후보 답안 중 하나를 고르는 1억 4,430만 파라미터 모델

Julia 1은 상태와 질문, 후보 답안을 함께 입력받아 선택·점수·불리언 결정을 내리는 다국어 모델입니다. 144.3M 파라미터로 여러 분류·라우팅 평가를 공개했으며, 짧은 후보 목록에 강점을 보인 반면 Banking77 파일럿에서는 비교 기준보다 낮은 정확도를 기록했습니다.

AI 요약

Supersonic Labs가 공개한 Julia 1은 주어진 문맥과 후보 답안을 비교해 하나를 고르는 144.3M 파라미터 모델입니다. 대화문을 생성하는 모델이 아니라 JHU CLSP의 다국어 mmBERT-small 인코더에 결정 헤드를 붙여 선택지를 점수화합니다. 입력은 상태(state), 질문(question), 후보 답안으로 구성하며, 하나의 인터페이스에서 분류·라우팅, 순서가 있는 점수 평가, 불리언 결정을 처리합니다.

평가 결과와 해석

2026년 9월 24일 H200에서 BF16 추론과 strict encoding을 사용해 측정한 저장소 체크포인트의 결과를 공개했습니다. Typed decisions 평가에서는 2,000개 질문 중 1,463개를 맞혀 73.15%를 기록했습니다. 비교 기준 Jev는 72.70%로 차이는 0.45%포인트입니다. 세부 유형별 정확도는 Choice 71.33%, Noul 80.67%, Score 68.88%입니다.

분류 파일럿은 각 데이터셋에서 100개 예시를 평가했습니다. AG News 4개 레이블에서는 94%로 Jev 비교값 91%보다 3%포인트 높았고, DAIR Emotion 6개 레이블에서는 86%로 비교값 48%보다 높았습니다. 반면 Banking77 72개 레이블 파일럿은 64%로, 제시된 비교값 87%를 밑돌았습니다. 이 평가는 72개 선택지를 한 번에 넣은 방식이 아니라 ranking과 상위 16개 후보(shortlist)를 거쳤습니다. Jev 수치는 새로 실행한 결과가 아니라 제공된 비교 기준입니다.

MASSIVE 시나리오 분류에서는 52개 로캘, 총 154,648개 사례 가운데 110,573개를 맞혀 매크로 정확도 71.50%를 기록했습니다. 포르투갈어 pt-PT는 86.25%, 영어 en-US는 86.75%입니다. 이 평가는 18개 시나리오 레이블을 대상으로 하며, 의도 분류나 슬롯 추출 성능을 측정하지 않습니다. 분류 파일럿과 MASSIVE 결과는 표본 및 평가 범위가 제한적이므로 새 업무의 성능을 보장하지 않습니다.

모델 구조와 입력 제약

기반 모델인 mmBERT-small은 범용 다국어 인코더이며, Julia 1은 이를 후보 답안 점수화 작업에 맞게 조정했습니다. 모델은 답안 ID를 호출자가 정한 그대로 반환합니다. Choice와 Score는 2~20개 후보를 받으며, Noul은 불리언 값을 다룹니다. Choice 확률은 후보 ID별로, Score 확률은 0부터 시작하는 인덱스별로, Noul 확률은 false와 true별로 제공합니다. 확률은 softmax 값이며 확실성을 보장하지 않습니다. 질문들은 배치로 처리하되 각각 독립적으로 점수화합니다.

한 번의 네이티브 호출에 넣을 수 있는 후보는 최대 20개입니다. 더 긴 목록은 계층형 Router로 후보 그룹을 좁힌 뒤 다시 순위를 매길 수 있지만, 좁히는 단계에서 정답이 탈락할 수 있습니다. 최종 확률도 전체 후보가 아니라 마지막 단계의 후보에만 적용됩니다. 런타임의 결합 입력 길이 기본 한도는 8,192 토큰이며, 공개된 과거 정확도 평가는 1,024 토큰으로 진행했습니다. 8,192 토큰 CPU 스모크 테스트는 통과했지만, 그 길이에서의 작업 정확도는 검증되지 않았습니다.

설치와 재현

Python 3.11 이상이 필요하며 CPU 추론은 표준 PyTorch 설치로 실행합니다. 저장소 전체를 내려받으면 550.5MiB 체크포인트가 포함됩니다. Python 런타임은 저장소의 julia/ 패키지이며, Julia 1은 Transformers의 AutoModelForMaskedLM이나 텍스트 생성 모델과 호환되는 대체품이 아닙니다. 별도 Julia-1-ONNX 저장소에는 ONNX 내보내기와 JavaScript WebGPU 어댑터가 있습니다.

제공된 재현 스크립트는 공개된 가중치 해시를 확인하고 고정된 테스트 Parquet 파일의 SHA-256도 검증한 뒤, 400개 사례의 2,000개 질문에 대한 CPU 결과를 기록합니다. 다만 과거 H200 BF16 측정과 이 CPU FP32 실행은 별도 결과입니다. 공개된 2026년 9월 26일 CPU 재현에서는 Choice 426/600, Score 542/800, Noul 483/600을 기록했습니다. 불리언 설명문을 문자 그대로 false/true로 바꾸면 같은 CPU 실행에서 Noul은 391/600이었습니다. 이전 named-question API가 불리언 설명문을 버리던 문제도 수정했다고 밝혔습니다.

사용 시 유의점

Julia 1은 질문에 제공된 후보를 비교하는 모델입니다. 입력에 없는 사실을 채우거나 대수 문제를 풀고 긴 계산을 이어가는 능력은 평가로 입증되지 않았습니다. 선택지 표현이 모호하거나 낯선 분야를 다루거나 레이블이 많으면 오류가 날 수 있습니다. 중요한 조치에 연결하기 전에는 실제 업무의 질문과 선택지를 그대로 넣어 평가해야 합니다. 모델 파일은 Apache 2.0으로 공개됐지만 학습 파이프라인은 포함하지 않습니다.

원문: Hugging Face / 번역·요약: Trawling