XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B
MiMo-V2.6-Distill-Qwen-9B — 에이전트 작업용 9B 모델
Xiaomi MiMo가 Qwen3.5-9B를 MiMo 생성 데이터로 지도 미세 조정한 9B 모델을 공개했습니다. 코딩, 사이버보안, 시각적 코딩, 일반 에이전트 작업을 다루며, 여러 평가에서 원본 Qwen3.5-9B보다 높은 점수를 기록했습니다.
- 주제
AI 요약
MiMo-V2.6-Distill-Qwen-9B는 Xiaomi MiMo가 Qwen3.5-9B를 기반으로 MiMo가 생성한 데이터에 지도 미세 조정(SFT)을 적용한 9B 모델입니다. 코딩, 일반 에이전트 작업, 시각적 코딩, 사이버보안 작업을 다룹니다. 이번 공개본은 에이전트 강화학습(agentic reinforcement learning) 연구를 시작하기 위한 SFT 체크포인트로 제공됩니다.
평가 결과
MiMo-V2.6 기술 보고서에 실린 결과를 보면, SWE Verified에서 Qwen3.5-9B의 avg@3 점수는 60.0점이고 MiMo-V2.6-Distill-Qwen-9B는 61.1점입니다. SWE Pro에서는 32.0점에서 44.6점으로 올랐고, MiMo Code (mini)에서는 19.5점에서 51.6점으로 올랐습니다. MiMo Code (mini)는 내부 평가 세트입니다.
사이버보안 평가인 MiMo Cyber (mini)에서는 5.7점에서 31.3점으로 변했습니다. 일반 에이전트 작업에서는 AutomationBench v1.0.6이 5.0점에서 30.3점으로, Terminal Bench 2.1이 27.0점에서 37.1점으로, Toolathlon-Verified가 25.9점에서 35.2점으로 올랐습니다. OfficeQA는 9.0점에서 19.5점으로, JobBench는 2.6점에서 18.3점으로, MiMo General (mini)는 28.5점에서 62.2점으로 변했습니다.
시각적 코딩 평가인 MiMo Visual Coding (mini)에서는 61.7점에서 64.0점으로 올랐습니다. 일반 작업과 시각적 코딩 결과는 avg@1, 코드와 사이버보안 일부 결과는 avg@3 지표를 사용합니다. MiMo Code, MiMo Cyber, MiMo General, MiMo Visual Coding은 내부 평가 세트입니다.
학습 데이터 구성
가중치를 적용한 SFT 데이터 혼합물은 총 77.4B 토큰이며, 이 중 손실 계산에 포함된 토큰은 27.2B개입니다. 코드 데이터는 23.2B 토큰으로 전체의 29.9%를 차지하고, 손실 계산 대상은 7.3B 토큰입니다. 사이버보안 데이터는 11.0B 토큰, 14.2%, 손실 계산 대상 4.8B 토큰입니다.
일반 데이터는 22.0B 토큰, 28.5%, 손실 계산 대상 5.7B 토큰입니다. 시각 데이터는 21.2B 토큰, 27.4%, 손실 계산 대상 9.4B 토큰입니다. 네 영역을 합치면 총 77.4B 토큰, 손실 계산 대상 27.2B 토큰입니다.
실행 방법
텍스트 생성에는 Qwen3.5를 지원하는 최신 SGLang 빌드가 필요합니다. 모델 카드가 제시한 서버 실행 명령은 다음과 같습니다.
sglang serve \\ --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B \\ --reasoning-parser mimo \\ --host 0.0.0.0 \\ --port 30000
체크포인트에는 토크나이저와 MiMo v2.6 채팅 템플릿이 포함되어 있습니다. OpenAI 호환 클라이언트로 요청할 때는 base_url을 로컬 SGLang 서버의 /v1로 지정하고, extra_body에 chat_template_kwargs: {"enable_thinking": True}를 넣어 사고 과정 생성을 명시적으로 활성화합니다. 응답에서는 reasoning_content로 사고 과정, content로 최종 답변을 읽습니다.
원문: Hugging Face / 번역·요약: Trawling