Introducing Microsoft-Decision-1, our model for fast decision-making
Microsoft-Decision-1 공개 — 빠른 구조화 판단을 위한 모델
Microsoft가 분류·라우팅·검증 같은 작업에 맞춘 의사결정 모델 Microsoft-Decision-1을 공개했습니다. 회사 측은 36개 벤치마크에서 정확도가 가장 높았고, GPT-6 Sol보다 측정 지연 시간이 35배 짧았다고 밝혔습니다.
- 주제
AI 요약
Microsoft-Decision-1은 문장을 생성하거나 복잡한 문제를 길게 추론하는 대신, 정해진 선택지 가운데 하나를 고르고 각 선택지의 확률을 반환하는 의사결정 모델입니다. Microsoft는 모델을 라우팅, 분류, 우선순위 지정, 검증, 워크플로 제어에 활용하도록 설계했으며 Microsoft Foundry와 OpenRouter에서 제공합니다.
모델 구성과 평가
Microsoft는 Qwen3.5-9B를 후처리해 단일 패스 의사결정 점수 산출에 맞췄습니다. 이후 Microsoft AI(MAI)와 OpenAI 모델을 기반으로 다시 구성할 계획이라고 밝혔습니다. API는 예·아니요, 객관식, 평점 선택을 지원합니다. 루브릭에 따라 AI 응답이나 에이전트 행동을 채점하는 작업도 처리합니다.
Microsoft가 공개한 비교에서는 학습에 쓰지 않은 벤치마크 36개, 약 15만 개 질문을 평가했습니다. 라우팅, 순위 지정, 긴 문맥, 다국어, 분포 밖 데이터, 추론, 안전성 작업을 포함했고, 회사는 이 비교에서 Microsoft-Decision-1이 가장 높은 정확도를 기록했다고 설명했습니다. 측정된 속도도 가장 빨랐으며, 준우승 모델 H2O-Lightning-4B v1.1보다 2.5배, GPT-6 Sol보다 35배 빨랐다고 밝혔습니다.
지연 시간·일관성·안전성
순차 작업에서는 판단 한 번마다 생기는 지연이 누적됩니다. Microsoft는 판단마다 100밀리초가 더 걸리면 20단계 워크플로에 2초가 추가된다고 설명합니다. Microsoft-Decision-1의 P50 지연 시간은 GPT-6 Sol보다 약 35배 짧다고 제시했습니다.
같은 요청의 표현, 선택지 설명, 순서, 키 이름, 서식 등을 여덟 방식으로 바꿔 판단이 뒤집히는 빈도도 측정했습니다. 평균 뒤집힘 비율은 1.3%였으며, 선택지 설명을 바꾸거나 순서를 뒤집고 섞었을 때는 판단이 바뀌지 않았다고 합니다. 확률 점수를 API 결과로 제공하므로, 애플리케이션은 예측 신뢰도에 따라 실행하거나 보류하고 사람에게 검토를 요청할 수 있습니다. 안전성 평가는 11개 벤치마크의 요청 5,250개로 진행했으며, 유해 요청을 거부하면서 일반 요청에 대한 유용성을 유지했다고 설명했습니다.
사내 활용 사례와 가격
Xbox Research는 설문, Steam, X의 개방형 의견 1만 건 이상을 연구자가 정한 주제별로 분류했습니다. Microsoft는 품질이 GPT-6 Sol과 경쟁할 만했고, 속도는 14배 이상 빠르며 비용은 200분의 1이었다고 밝혔습니다. Copilot 팀은 채팅과 에이전트 응답 품질 평가에서 GPT5.6 Luna와 비슷한 수준, 100배 빠른 처리 결과를 얻었다고 합니다. 사고 대응 지식 검색과 과학 실험의 적응형 재계획에도 활용했습니다. 과학 실험 사례에서는 LLM 기반 점수보다 일관성이 46배 높고 속도는 3배 빨랐으며, 재계획 전체는 거의 4배 빨라졌다고 설명했습니다.
입력 가격은 토큰 100만 개당 0.042달러이며 출력 토큰은 무료입니다. Microsoft Foundry와 OpenRouter에서 사용할 수 있습니다.
Reddit 반응
- @2goodstudydaydayup — 기술 보고서를 살펴본 사람이 있나요? 프런티어 LLM이 아니라 의사결정 모델이라면 어떤 벤치마크를 쓰고 누가 주 사용자층인지 궁금합니다. ChatGPT나 Claude와 비교하는 건 사과와 오렌지를 비교하는 것 같습니다.
- @puzzleheadbutbig — 어쨌든 ChatGPT나 Claude와 비교하는 건 아닙니다. 요약하면 Jev보다 낫고 가격은 정확히 같습니다.
- @donald_314 — 차트에서는 GPT-6 Sol과 직접 비교하고 있습니다.
- @puzzleheadbutbig — LLM이 의사결정에 약한 이유를 보여주는 참고 비교입니다. 36개 벤치마크 평균 정확도와 보정 점수에는 넣지 않았습니다. TypeSafe도 Jev를 처음 발표할 때 같은 방식을 썼습니다.
- @MyGoldfishGotLoose — 제가 놓친 게 있을지 모르지만, 자체 지연 시간과 Jev의 지연 시간은 비교하면서 Jev와 의사결정 벤치마크를 비교한 자료는 없는 것 같습니다. 의도한 건가요, 방법론의 사각지대인가요, 아니면 제가 놓쳤나요?
- @TehBrian — Jev처럼 병렬 추론을 할 수 있나요? 페이지의 요청 분류 데모 영상에서는 요청을 하나씩 분류합니다.
- @madaboutglue — 그게 중요한 질문입니다. 제가 이번 발표를 제대로 읽었다면 답은 아니오입니다. Jev는 약 150밀리초에 판단 255개를 내릴 수 있습니다. 이번 발표에서 Microsoft는 판단마다 지연이 추가된다고 했습니다. 한 번에 하나씩 판단하는 OpenAI Decisions API 쪽 경쟁 모델에 더 가깝습니다.
- @TehBrian — 저도 그렇게 생각했습니다. 그렇다면 자체 85밀리초와 Jev의 240밀리초를 비교한 지연 시간 그래프에서 중요한 정보가 빠졌습니다. 단일 요청 지연이 최우선이면 더 나은 선택일 수 있지만, 대부분의 경우 처리량이 더 중요할 것 같습니다.
- @arkuto — 출력 토큰 하나만 내도록 제한한 LLM입니다. 그게 전부입니다. 작은 모델에 긴 상황을 주고 예나 아니요만 답하게 해도 됩니다. 모든 경우에 추론이 필요한 건 아니며, 추론이 오히려 성능을 해치는 경우도 많습니다.
- @Healthcarepls — 무례하게 굴려는 건 아니지만 Microsoft 모델을 누가 쓰나요? ChatGPT와 Claude가 있는데 왜 이걸 쓰죠?
- @Helpful_Program_5473 — 프런티어 LLM이 아니라 의사결정 모델입니다. Jev와 더 비슷합니다.
- @Minetorpia — 사실상 Microsoft 생태계에 묶인 대기업들이 씁니다.
- @DrDan21 — 이런 모델은 LLM과 함께 써서 간단한 판단이나 분류를 훨씬 싸게 처리합니다. 문서에 특정 텍스트가 있는지 묻는다면 LLM이 추론하는 대신 의사결정 모델에 맡기고 결과를 해석하게 할 수 있습니다. 그 작업을 수백만 번 하면 비용 차이가 커집니다.
- @Healthcarepls — Microsoft 모델을 누가 쓰냐고 물은 건 ChatGPT와 Claude가 있는데 왜 이걸 쓰냐는 뜻입니다.
- @green_meklar — ChatGPT나 Claude의 대체재가 아니라 Jev의 대체재입니다. Microsoft가 자사 소프트웨어와 서비스에 직접 통합해 성능을 높이고 비용을 줄일 수 있다는 점도 있습니다.
원문: Microsoft / 번역·요약: Trawling