Phocinae/Phocinae-Largha-150M-v1
Phocinae-Largha-150M-v1 — 에이전트용 로컬 구조화 의사결정 모델
Phocinae-Largha-150M-v1은 에이전트의 승인·도구 선택 같은 정형화된 판단을 로컬에서 처리하는 1억 4,430만 매개변수 모델입니다. 자체 테스트에서 영어 정확도 0.906을 보고했지만 학습 데이터에 맞춘 전문 모델이며, 별도 JevBench에서는 공개 기준을 통과하지 못했습니다.
- 주제
AI 요약
Phocinae-Largha-150M-v1은 대화나 문장 생성을 위한 모델이 아니라, 에이전트 실행 중 반복되는 판단을 처리하는 로컬 의사결정 모델입니다. 입력으로 상태 설명과 유형을 지정한 질문 목록을 받고, 예·아니요, 선택지 하나, 2~10점 척도로 답합니다. 한 번의 순전파(forward pass)로 여러 판단을 묶어 처리하며, 생성 토큰을 내놓지 않습니다.
모델과 실행 방식
모델은 1억 4,430만 매개변수 규모이며, mmBERT-small을 기반으로 합니다. 은닉 차원은 384, 레이어는 22개, 어텐션 헤드는 6개이고, 토크나이저 어휘 크기는 25만 6천입니다. 기본 문맥 길이는 8,192토큰이지만, 의사결정 헤드는 기본 512토큰 입력을 처리하며 어텐션 창은 192토큰입니다. 저장된 가중치 크기는 288.6MB이고, 추론 피크 메모리는 1.6GB로 안내합니다.
제공된 런타임 phocinae-server는 가중치를 불러오는 로컬 FastAPI 서비스입니다. 기본 주소는 127.0.0.1:8155이며, 순수 PyTorch 추론을 사용합니다. Python 엔진이나 HTTP API에서 같은 판단 프로토콜을 호출할 수 있습니다. 질문 유형은 noul의 참·거짓, choice의 0부터 시작하는 선택지 인덱스, score의 2~10 정수입니다. 오류 응답에는 질문 유형 오류, 64개 초과 질문, 2MiB 초과 요청 등이 포함됩니다.
벤치마크 수치와 해석
영어 typed-decisions 평가에서는 400개 사례, 총 2,000개 판단에서 정확도 0.906을 보고합니다. 다만 이 수치는 해당 데이터셋의 학습 분할에 맞춰 학습한 전문 모델 결과입니다. 자료는 이를 zero-shot 범용 모델 결과와 직접 비교하지 말라고 명시합니다. Laya의 0.766, JEV의 0.727, meraGPT의 0.768은 각각 별도 방식으로 측정한 비교 수치이며, 조건이 같지 않습니다. 제출 결과가 교사 모델의 자체 일치도 상한 0.735를 넘었다는 점도 함께 공개하며, 라벨링 특성을 학습했을 가능성을 설명합니다.
중국어 정확도는 0.848입니다. 하지만 평가 사례는 기계 번역됐고 학습에도 기계 번역 중국어 약 2,400행과 원어민 중국어 약 1,400행이 들어갔습니다. 따라서 자료는 이를 영중 언어 전이 능력을 검증한 zero-shot 결과가 아니라 학습 데이터 분포 안에서 측정한 결과로 분류합니다.
공개 JevBench 231개 항목에서는 231개 중 126개를 맞혀 0.5455를 기록했습니다. 모델 카드가 제시한 통과 기준 58.4%에는 못 미칩니다. 도구 선택 세부 항목에서는 12개 중 12개를 맞혔지만 표본이 12개뿐입니다. 도구 이름이 의미상 비슷하면 혼동하는 알려진 문제도 있습니다. 예를 들어 최신 제품 출시 소식을 찾는 사례에서 web_search 대신 fetch_url을 고른 재현 사례가 있으며, 신뢰도는 약 0.33이었습니다. 낮은 신뢰도의 선택을 최종 결과로 확정하지 말고 상위 모델로 넘기라고 안내합니다.
신뢰도 기반 라우팅과 성능
모델은 신뢰도 임계값으로 판단을 걸러 상위 LLM 호출을 줄이는 용도도 제안합니다. 임계값 τ=0.6으로 평가했을 때 남겨둔 판단의 정확도는 0.906에서 0.9936으로 높아졌고, LLM 호출은 55.0% 줄었습니다. 남겨둔 판단만 보면 높은 정확도지만, 전체 라우팅 정확도는 0.8135입니다. 임계값은 평가 세트에서 조정했으므로 자료는 도메인별 재검사를 권합니다. τ=0.5에서는 LLM 호출 감소 폭이 79.6%였다고 보고합니다.
지연 시간은 RTX 5090에서 GPU fp16 기준 p50 21.0ms입니다. CPU 단일 스레드는 사례당 p50 1.64초이며, CPU 8스레드 배치 처리량은 초당 8~20개 판단입니다. CPU 수치는 한 사례에 상태 하나와 질문 5개를 넣은 조건입니다. 자료는 같은 판단의 로컬 처리 시간과 API 왕복 시간을 비교하지만, API 측정은 자체 실험 또는 별도 제3자 측정으로 구분해 제시합니다.
보정과 사용 범위
기본 배포 열의 기대 보정 오차(ECE)는 영어 0.2519, 중국어 0.1941입니다. 함께 제공하는 보정 열을 적용하면 각각 0.0168, 0.0152로 낮아집니다. 추론 시 적용하는 온도 값도 모델 저장소 설정에 들어 있습니다. 신뢰도를 라우팅 기준으로 쓸 때는 이 차이를 고려해야 합니다.
용도는 명령 승인, 도구 라우팅, 단계별 검사, 문서 분류, 출력 검수처럼 질문과 답 형식이 정해진 판단입니다. 반대로 자유 대화, 긴 문서 추론, 세계 지식 질의에는 적합하지 않다고 밝힙니다. 안전 판단을 단독으로 맡기는 용도도 아닙니다. 자료는 첫 번째 필터로 쓰고 불확실한 사례는 상위 모델로 넘기라고 권합니다. 모델은 Apache-2.0 라이선스로 배포하며, 학습 기반 인코더 mmBERT-small은 MIT 라이선스입니다.
원문: Hugging Face / 번역·요약: Trawling