autotrust/GEV-26B-Decide
GEV-26B-Decide 공개 — 불확실할 때만 추론하는 Gemma 기반 의사결정 모델
AutoTrust AI가 Gemma-4-26B-A4B-it을 바탕으로 선택지별 확률을 출력하는 오픈 웨이트 모델 GEV-26B-Decide를 공개했습니다. 기본 모드(System 1)는 B200에서 약 45ms에 응답하고, 불확실한 질문에는 추론 모드(System 2)를 추가해 수학·과학·논리 벤치마크 정확도를 높입니다. 다만 추론은 수 초에서 수십 초가 걸리고 분류·검색 작업에는 이득이 적습니다.
- 주제
AI 요약
GEV-26B-Decide는 질문에 답 하나를 생성하는 대신 각 선택지의 확률을 출력하는 의사결정 모델입니다. Gemma-4-26B-A4B-it을 기반으로 하며 전체 파라미터는 26B, 토큰당 활성 파라미터는 약 4B입니다. 텍스트와 이미지를 입력받고, 최대 256K 토큰 문맥을 지원합니다. AutoTrust AI가 공개한 오픈 웨이트 모델이며 TypeSafe AI의 호스팅 폐쇄형 모델 TypeSafe Jev 1.13과는 별개입니다.
두 단계 추론
System 1은 한 번의 순전파(forward pass)로 예·아니요, 2~256개 선택지 중 하나, 0~5 점수를 판정하고 각 답의 확률을 반환합니다. B200에서 단일 요청 중앙 지연 시간은 약 45ms입니다. System 2는 같은 Gemma 백본의 사고 모드를 사용합니다. 적응형 모드에서는 System 1이 먼저 답하고, 가장 높은 확률이 기본 임계값 0.8보다 낮을 때만 System 2가 추론합니다. 이후 두 분포를 절반씩 섞어 최종 확률을 계산합니다. System 2의 답만 쓰면 확률이 지나치게 한쪽에 치우칠 수 있어 혼합 방식을 적용했다고 설명합니다.
공개 벤치마크 6종의 검증 질문 1,754개에서 System 1 정확도는 73.3%, 적응형 모드는 83.4%, 항상 추론하는 모드는 83.8%였습니다. 적응형 모드는 항상 추론했을 때 얻는 정확도 향상의 96%를 달성하면서 질문의 47.8%에서만 추론을 실행했습니다. 확률 보정 오차(ECE)는 두 모드 모두 0.035였습니다. 다만 데이터셋별 결과는 다릅니다. AQuA-RAT는 68.1%에서 89.0%로, LogiQA는 55.3%에서 80.3%로 올랐지만 CommonsenseQA는 86.7%에서 85.0%로 낮아졌습니다.
추론이 효과적인 작업과 그렇지 않은 작업
게임 퍼즐 200개씩 평가한 결과, 적응형 모드는 지뢰찾기 안전 칸 판별을 21.0%에서 86.0%로, Wordle 단어 선택을 52.0%에서 100%로, Connect Four 한 수 판별을 54.0%에서 99.5%로, 스도쿠 숫자 선택을 76.0%에서 99.5%로 높였습니다. 반면 미로 첫 이동은 48.5%에서 68.0%에 그쳤고, 체스 한 수 메이트 문제는 46.5%에서 78.0%로 개선됐지만 추론이 자주 토큰 예산에 도달했습니다. Snake나 장기 진행이 필요한 게임, 그림 인식에는 추론 효과가 거의 없거나 결과가 나빠졌습니다.
Decision Index의 지식·추론 영역 10개 벤치마크에서는 점수가 0.429에서 0.602로 상승했습니다. GPQA Diamond 정확도는 42.9%에서 78.6%, CRUXEval은 67.5%에서 90.7%, MMLU-Pro는 65.0%에서 84.6%, BBH는 75.0%에서 92.0%로 올랐습니다. 반면 전문가 수준 문제 HLE는 System 1에서 우연 수준보다 낮은 8.4%였고, 추론을 켜도 17.8%로 우연 기준 16.4%에 가까웠습니다. ChessBench도 적응형 추론이 개선을 만들지 못했습니다.
추론에 드는 시간은 적지 않습니다. 8,192토큰 예산을 적용한 지식·추론 벤치마크에서 요청의 66%가 추론했고, 중앙 추론 길이는 8,192토큰이었습니다. B200 한 장에서 추론 없는 응답은 약 0.05초지만, 추론을 포함한 영역별 중앙 지연 시간은 13.4초, 90백분위 지연 시간은 33초로 추정됩니다. 추론을 끄거나 임계값·토큰 예산을 낮추면 속도를 우선할 수 있습니다. Decision Index가 요구하는 요청당 중앙 지연 시간 1,000ms 조건은 적응형 모드의 지식·추론 평가에서 충족하지 못했습니다.
분류·검색과 시각 입력
도구 호출과 의도 분류 벤치마크에서는 소폭 개선이 있었고, 검색 성능은 거의 변하지 않았습니다. BANKING77 매크로 F1은 88.0%에서 85.0%로 하락했습니다. 제작자는 분류, 검색, 도구 라우팅에는 System 1을 쓰고, 추론 문제에만 사고 모드를 켜라고 권합니다. 이미지 입력은 Gemma-4의 비전 인코더를 활용하지만 의사결정 헤드는 텍스트로 학습했습니다. 합성 이미지의 색·모양·숫자 판별에서는 각 30장 모두 정답이었고, VL-RewardBench 점수는 78.4%였습니다. 이미지 기반 결정은 제로샷 평가입니다.
브라우저 조작 실험에서는 번호가 붙은 요소와 요소 텍스트를 제공했을 때 무작위 다단계 작업 60개 중 95%를 완료했습니다. 클릭당 약 85ms로, 비교 대상 JEV-27B-VL의 260ms보다 빨랐습니다. 번호만 제공하면 완료율은 15%로 떨어졌습니다. MuJoCo 로봇 팔 집기 실험은 20개 장면 중 40%를 완료했습니다. 성공적으로 집은 9개 큐브 가운데 8개는 트레이에 넣었지만, 전체 완료율은 JEV-27B-VL의 75%보다 낮았습니다.
실행과 평가 범위
저장소는 vLLM 서버와 POST /v1/decide 엔드포인트를 제공합니다. 80GB 이상 GPU 한 장을 권장하며, Gemma-4를 지원하는 vLLM 빌드와 동봉 패치가 필요합니다. 어댑터와 결정 헤드는 Apache-2.0 라이선스지만, 기반 Gemma-4 모델에는 별도의 Gemma 4 이용 약관이 적용됩니다. Decision Index 점수 62.48은 제작자가 일부 영역에 적응형 추론을 적용해 직접 계산한 값이며 공식 순위표 항목이 아닙니다. 일부 데이터셋의 공개 학습 분할을 학습에 사용했고, 테스트 분할은 사용하지 않았다고 밝혔습니다. 한국어 성능 수치는 제시하지 않았으며, 고위험 의사결정에는 확률을 확인하는 절차 없이 사용하지 말라고 안내합니다.
원문: Hugging Face / 번역·요약: Trawling