Hacker News

Show HN: JevBench, a reproducible benchmark for typed decision models

Show HN: 타입 지정 의사결정 모델을 위한 재현 가능한 벤치마크, JevBench

JevBench는 상태와 제한된 평가 기준을 입력받아 구조화된 답을 내는 Jev 계열 모델을 정확도·보정·속도·비용으로 비교합니다. 534개 결정 과제를 같은 조건에서 측정한 v1.3.0 결과와 점수 산정 규칙을 공개해, 모델 선택 시 성능과 운영 비용을 함께 살피게 합니다.

AI 요약

JevBench는 상태(state)와 제한된 평가 기준(rubric)을 입력으로 받고, 정해진 타입의 답을 출력하는 Jev 계열 의사결정 모델을 비교하는 벤치마크입니다. 제작진은 v1.3.0에서 52개 시스템에 동일한 534개 결정 과제를 실행했습니다. 쉬운 과제 72개, 표준 과제 96개, 판정 과제 146개, 어려운 과제 220개로 구성되며, 하네스와 공개 과제, 채점 규칙은 MIT 라이선스로 공개합니다. 결과는 시험한 구성의 성능을 나타내며 모든 실제 사용 환경을 대표하지는 않는다고 밝힙니다.

네 가지 축을 같은 비중으로 평가합니다

공식 JevBench Score는 지능(Intelligence), 보정(Calibration), 속도(Speed), 비용(Cost)을 각각 25% 반영한 기하평균입니다. 한 축의 낮은 점수가 다른 축의 높은 점수로 상쇄되지 않도록 설계했습니다. 지능 점수는 무작위 추측과 모든 정답 사이의 간격을 얼마나 좁혔는지 측정하고, 쉬움·표준·판정·어려움 과제에 각각 14%, 28%, 28%, 30% 가중치를 줍니다. 지능이 50점 미만이면 점수에 추가 페널티를 적용해, 추측에 가까운 시스템이 빠르고 저렴하다는 이유만으로 상위에 오르지 않게 했습니다.

보정은 어려운 과제에서 모델의 확신도와 실제 정답률이 맞는지, 확률 분포 답변이 정답 분포와 일치하는지 측정합니다. 속도는 요청을 한 번에 하나씩 보냈을 때의 지연 시간을 바탕으로 합니다. 자체 호스팅 및 데모 엔드포인트는 운영 부하를 가정해 지연 시간을 두 배로 조정하고 자체 서버에는 0.15초를 더했습니다. 제작진은 이 보정이 측정값이 아니라 가정이라고 명시하며, 원시 측정값도 공개합니다. 비용은 토큰 1,000개가 아니라 결정 1,000건당 달러로 표시합니다. Jev 1.13.0은 결정 하나에 입력 토큰 약 950개를 사용해, 공개 요금 기준 결정 1,000건당 약 0.040달러가 듭니다. 요금표가 없는 모델의 비용은 호스팅 요금을 바탕으로 추정합니다.

결과와 순위 해석

Jev 1.13.0이 74.4점으로 1위, Qwen3.5-4B 기반 오픈 재구현 SemIf가 73.1점으로 2위, diffusion-gemma 기반 djev가 73.0점으로 3위입니다. SemIf는 Jev보다 속도와 추정 비용 점수가 높고, 지능과 보정 점수는 낮습니다. GPT-5.6 Luna는 지능 점수 95.3으로 가장 높지만 비용 점수가 28.5여서 전체 순위는 14위입니다. 정확도만으로 순위를 정하지 않고 운영 비용과 지연 시간까지 함께 볼 때 결과가 달라지는 사례입니다.

classifier.dev는 83.6점으로 전체 순위권보다 높은 점수를 받았지만, Jev를 실행하는 서비스라 순위에서는 제외하고 별도 언급에 실었습니다. 같은 모델을 모델 자체의 가격과 서비스 가격으로 중복 등재하는 일을 피하기 위해서입니다. 과제 응답을 전부 완료하지 않은 시스템도 순위에 넣지 않고 부분 실행으로 표시합니다.

가중치를 바꾸면 순위도 바뀝니다. 벤치마크는 보정 축을 제외하고 균형·정확도·속도·비용을 강조하는 다른 조합도 제공합니다. 이 순위는 게시된 축 점수에서 브라우저가 다시 계산하는 보기이며 공식 점수와 구분됩니다. 난이도별로도 전체, 쉬운 과제, 어려운 과제 결과를 따로 확인할 수 있습니다.

재현성과 한계

실행은 독일 서버에서 한 번에 요청 하나씩 진행했습니다. 공개 과제 결과는 확인할 수 있지만, 홀드아웃 및 외부에서 가져온 과제의 텍스트는 공개하지 않습니다. 제작진은 같은 하네스와 고정된 과제를 사용하고 결과 JSON 해시를 공개하지만, 자체 제작 벤치마크인 만큼 결과는 이 프로토콜과 시험 구성에 한정됩니다. 일부 모델은 라이선스, 실행 환경, 공개 엔드포인트, 출력 스키마 문제로 측정하지 못했습니다. 이는 해당 실행에서의 가용성 문제이지 모델 품질 평가가 아니라고 설명합니다.

Hacker News 반응

  • @sean_pedersen — 이와 비슷한 벤치마크도 있습니다. 결과가 서로 맞지 않는 것 같고 모델 구성도 다릅니다. 아직 더 다듬을 시간이 필요해 보입니다.
  • @ks2048 — 여기서 정확히 어떤 테스트를 하는지 알아보려 했습니다. 질문 몇 개를 찾았는데, 예를 들면 “사용자 메시지가 어떤 의도를 표현하나요?”라는 지시문에 “테일러 스위프트를 틀어 줘”라는 상태를 주고, 정답을 “play_music”으로 지정합니다.
  • @adityamishra241 — 과제 분포를 어떻게 다루며, 이 534개 질문에 맞춰 조정된 모델이 벤치마크에서 유리해지는 일을 어떻게 막나요?
  • @DylanMerigaud — 전체 실행에서 영어 결정 과제 534개면 상당한 양으로 보입니다.
  • @janalsncm — BGE 리랭커를 목록에 넣으면서 실제 제로샷 분류기인 BART는 넣지 않은 점이 이상합니다.
  • @hbrn — 4천만 달러를 투자받고 2년간 잠행한 제품이 며칠 만에 만들어졌고 미세 조정도 하지 않은 것으로 보이는 SemIf와 비슷한 성능을 냅니다. SemIf는 브라우저에서 실행되고 Jev는 가격이 두 배입니다. Jev가 계속 자기 자신을 Qwen이라고 생각하는 게 놀라운가요? Jev가 사기일지도 모른다는 생각이 거의 듭니다.
    • @Retro_Dev — Jev의 장점은 빠르다는 것 아닌가요? Qwen 기반 모델과 Jev의 에너지 비용을 비교해 보고 싶습니다. 물론 Jev는 현재 닫혀 있으니 알 수 없지만요. “Jev는 혁신적이고 훌륭하니 믿고 더 비싼 돈을 내세요. 데이터는 우리에게 보내야 합니다”라는 말처럼 들립니다.
  • @swyx — Jev CEO가 벤치마크를 피한 이유에 관한 글입니다.
    • @jldugger — 흥미롭네요. 서비스 약관 위반 문제가 어떻게 해결됐는지 궁금했습니다. “벤치마크 금지” 조항은 제한된 미리 보기 사용자에게만 적용하려던 것이고, 출시 때 실수로 삭제하지 못했다고 하네요.
    • @tomrod — 그건 Jev를 아예 무시할 훌륭한 이유라고 봅니다. “믿되 검증하라”는 말은 그럴듯한 문구에 그치지 않습니다. 모델과 코드가 빠르게 출시되는 환경에서는 그렇게 운영해야 합니다.

원문: Benchmark Heaven / 번역·요약: Trawling