Hugging Face

akhilaaa3/Jev-Omni

Jev-Omni — 텍스트·이미지·음성·동영상 선택지 분류 모델

Jev-Omni는 Gemma 4 12B IT를 3만 개 질문으로 미세 조정한 멀티모달 분류 모델입니다. 설명을 생성하는 대신 선택지별 확률을 출력하며, 공개 벤치마크와 추론 속도, 실행 조건을 함께 제시합니다.

AI 요약

Jev-Omni는 질문과 선택지를 입력하면 각 선택지를 고를 확률을 반환하는 멀티모달 의사결정 분류 모델입니다. 텍스트뿐 아니라 이미지, 음성, 동영상도 입력으로 받습니다. 답변 설명을 생성하지 않고 선택지별 점수를 출력하는 방식이며, Gemma 4 12B IT를 기반으로 질문 3만 개를 사용해 미세 조정했습니다.

벤치마크 결과

DecisionBench Medium에서는 80개 시나리오, 293개 질문을 평가해 정확도 87.57%, micro accuracy 86.01%를 기록했습니다. JevBench에서는 서로 대응하는 195개 그룹의 231개 결정을 평가해 각각 86.15%, 87.45%를 기록했습니다. MMAU 1,000개 질문에서는 micro accuracy 63.10%, MVBench 14개 과제의 2,786개 질문에서는 정확도 53.10%, micro accuracy 53.09%입니다. DecisionBench와 JevBench의 정확도는 시나리오나 그룹별 점수를 같은 비중으로 평균한 값입니다.

모델 카드에는 비교 대상으로 Inkling과 Qwen3.5-397B-A17B도 실려 있습니다. Jev-Omni의 MMAU 점수는 63.10%로, Inkling의 공식 보고 점수 77.20%보다 낮습니다. MVBench에서는 Jev-Omni가 53.10%, Qwen3.5-397B-A17B가 77.60%입니다. 비교 대상의 점수는 각 개발자가 공식 발표한 값이며 평가 절차가 다를 수 있다고 명시합니다. 따라서 표의 수치만으로 모델 간 성능을 직접 비교하기는 어렵습니다.

실행과 추론 속도

CUDA GPU가 필요합니다. FP32 가중치는 실행 중 추가 메모리를 제외하고 약 50GB를 차지하며, 추론에는 BF16 autocast를 사용합니다. 패키지 의존성을 설치한 뒤 Hugging Face Hub에서 모델을 내려받아 load_jev_omni()로 불러옵니다. predict()에 상태 설명, 질문, 선택지를 전달하면 결과를 받습니다. 이미지·음성·동영상 입력은 파일 경로와 모달리티를 추가합니다. 음성 입력은 최대 30초이며, 동영상은 16프레임을 사용합니다. 음성 처리를 위해 ffmpeg도 필요합니다.

최적화된 백엔드에서 H200 GPU로 측정한 워밍 상태 중앙 지연 시간은 약 2천 토큰 텍스트 입력 83ms, 이미지 26ms, 13초 음성 31ms, 16프레임 동영상 504ms입니다. 각 수치는 요청 20회의 중앙값이며 전처리와 네트워크 시간은 포함하지 않습니다. 선택지는 최대 256개까지 입력할 수 있지만, 품질을 뒷받침하는 범위는 20개 이하라고 안내합니다.

비용 산정과 라이선스

비용 비교에서 Jev-Omni는 OpenRouter의 Gemma 3 12B 입력 토큰 요금인 백만 토큰당 0.05달러를 적용합니다. 분류 모델은 출력 토큰을 생성하지 않습니다. 분류 모델은 질문마다 한 번 호출하고 각 호출에 상태를 다시 넣는 방식으로 계산했습니다. 채팅 모델은 한 상태의 질문을 한 번의 호출로 함께 묻는 가장 저렴한 방식으로 계산했습니다. 이 데이터에서는 채팅 모델에 질문별 호출 방식을 적용하면 입력 토큰이 2.82배로 늘지만, 비용 비교에서 모델 순서는 바뀌지 않는다고 설명합니다.

라이선스는 Apache-2.0이며 Gemma 4 조건을 따릅니다. 데이터셋 권리는 별도입니다. 작성자는 이 프로젝트가 독립적인 공개 모델이며 TypeSafe AI나 Jev 모델과 제휴·승인·후원을 받지 않았고, Jev의 출력으로 학습하지 않았다고 밝힙니다. 중간 난이도 평가의 ECE는 10개 구간 기준 0.0400입니다.

원문: Hugging Face / 번역·요약: Trawling