XiaomiMiMo/MiMo-V2.6-Pro-RL
MiMo-V2.6-Pro-RL — 자기개선을 겨냥한 대규모 강화학습 모델
Xiaomi MiMo Team이 텍스트·이미지·비디오·오디오와 100만 토큰 컨텍스트를 지원하는 MiMo-V2.6-Pro-RL을 공개했습니다. 여러 영역을 한 번에 학습하는 비동기 RL, 그룹 단위 에이전트 평가, Sparse MoE 구조를 사용하며 코드·에이전트·사이버보안 벤치마크 결과와 SGLang·vLLM 실행법을 함께 제공합니다.
- 주제
AI 요약
MiMo-V2.6-Pro-RL은 MiMo-V2.6 시리즈의 플래그십 체크포인트입니다. Xiaomi MiMo Team은 강화학습(Reinforcement Learning, RL) 연산량과 환경 다양성, 평가기(Grader) 연산량을 함께 늘려 모델이 탐색과 피드백을 반복하며 능력 범위를 넓히는 방향을 제시합니다. 모델 하나에서 텍스트, 이미지, 비디오, 오디오를 처리하고 최대 100만 토큰 컨텍스트를 사용합니다. 긴 저장소, 도구 실행 기록, 여러 세션에 걸친 에이전트 작업을 대상으로 설계했습니다.
한 번의 혼합 RL 학습
학습은 코딩, 일반 에이전트, 시각 작업, 사이버보안 작업을 별도 모델이나 별도 RL 단계로 나누지 않고 한 번의 혼합 RL 실행으로 처리합니다. 서로 다른 작업과 여러 평가 하니스(harness)를 같은 배치에 섞습니다. 학습 중 얻은 전략을 다른 영역으로 옮기고, 훈련에서 직접 보지 않은 하니스에도 대응하도록 설계했습니다.
정책 최적화에는 비동기 Group Relative Policy Optimization(GRPO)을 사용합니다. 한 단계마다 1,568개 프롬프트에서 각각 16개 rollout을 생성하며, 업데이트 하나에 수십억 개 토큰이 들어갑니다. 대규모 rollout을 병렬로 수집하고 정책을 갱신하는 방식입니다.
그룹 단위 평가와 자기개선 루프
단순한 성공·실패 이진 보상만으로는 모두 통과한 결과 사이의 품질 차이를 구분하기 어렵다고 설명합니다. MiMo-V2.6-Pro-RL은 같은 프롬프트에서 나온 rollout을 그룹으로 묶고, 정책이 직접 만든 결과를 서로 비교하는 agentic grader를 사용합니다.
Groupwise Reward Synthesis(GRS)는 서로 대비되는 rollout을 오프라인에서 분석해 작업별 평가 기준을 만듭니다. 생성한 rubric의 품질과 실제 테스트 결과를 함께 사용해 보상 신호를 구성합니다. Groupwise Advantage Redistribution(GAR)은 온라인 단계에서 통과한 trajectory의 순위를 매기고 더 높은 품질의 결과로 advantage를 이동시킵니다. 이 과정은 단순히 통과 여부만 보상하지 않고, 같은 작업을 더 짧은 경로와 더 적은 토큰으로 해결하는 방향을 유도합니다. 모델 자신의 샘플을 평가 기준으로 삼아 탐색, 평가, 정책 갱신이 이어지는 자기개선 루프를 구성합니다.
RL 정렬 과정은 self-correction에서 시작합니다. 모델이 잘못 정렬된 응답을 스스로 검토하고, 근거를 갖춘 다음 단계로 다시 작성한 결과를 cold start 데이터로 사용합니다. 이후 환경을 더 어렵게 만드는 hardening, 적대적 선별(adversarial screening), 검증기 교차 확인(verifier cross-check)을 적용해 reward hacking을 점검합니다.
MOPD2를 이용한 후속 증류
혼합 RL이 끝난 뒤에는 Multi-Prefix Multi-Teacher On-Policy Distillation(MOPD2)을 적용합니다. 학생 모델의 자율 rollout과 prefix 조건이 붙은 single-turn rollout을 결합하는 방식입니다. Teacher-Prefix와 SFT-Prefix를 사용하며, teacher trajectory와 SFT 시연에서 얻은 이력을 재활용합니다.
이 방법은 앞선 대화 턴을 다시 생성하지 않고도 특정 의사결정 지점부터 학습하게 합니다. 따라서 결과를 자동으로 검증하기 어려운 작업에도 teacher의 이력과 SFT 예시를 활용해 능력을 확장합니다.
모델 구조
전체 1.02T 파라미터 중 토큰 처리 때 활성화되는 파라미터는 42B인 Sparse Mixture of Experts(MoE) 구조입니다. 최대 컨텍스트 길이는 1M 토큰입니다. Vision Encoder는 681M 파라미터의 MiMo ViT이며 28개 레이어로 구성됩니다. 이 중 24개는 Sliding Window Attention(SWA), 4개는 Full Attention을 사용합니다. AudioTokenizer는 20개 RVQ codebook을 포함한 24개 레이어, 308M 파라미터로 구성되고, 별도의 audio patch encoder는 6개 레이어와 127M 파라미터를 사용합니다.
언어 모델 본체는 총 70개 레이어이며 SWA 60개와 Global Attention(GA) 10개로 나뉩니다. hidden size는 6,144이고, attention의 Q/KV head 수는 128/8입니다. sliding window 크기는 128입니다. Routed Expert는 전체 384개이며 토큰마다 8개를 활성화합니다. 첫 Transformer block은 global attention과 dense FFN을 사용합니다. 나머지 블록은 local SWA와 GA를 교차 배치하고, 두 attention 경로 모두 shared expert 없이 sparse MoE FFN을 사용합니다.
Multi-Token Prediction(MTP)은 5개 레이어의 speculative decoder로 구성됩니다. DFlash 방식의 5-layer SWA MTP drafter가 한 번의 forward pass에서 뒤따르는 토큰 7개를 예측하고 병렬 검증을 진행합니다.
벤치마크 결과
원문 표에서 MiMo-V2.6-Pro-RL은 코드 에이전트 부문에서 DeepSWE v1.1 71.9, ProgramBench 26.5, MiMo Code Bench 63.2를 기록합니다. 일반 에이전트 부문에서는 AutomationBench v1.0.6 53.1, Toolathlon-Verified 76.9, GDPval-AA 2.1 1673, Agents’ Last Exam 31.6, Terminal Bench 4.0 34.9, Terminal Bench 2.1 89.9, OSWorld-Verified 82.0, JobBench 62.0입니다.
사이버보안 부문 점수는 CyberGym 94.0, MiMo Cyber Bench 80.2, ExploitGym 17.8, ExploitBench 47.9, SEC Bench Pro 66.3입니다. 시각 에이전트 평가인 MiMo VisualCoding에서는 72.3을 기록합니다. 같은 표에서 MiMo-V2.6-Flash-RL은 각각 67.9, 26.0, 61.2의 코드 에이전트 점수를 보였고, CyberGym 95.1과 MiMo Cyber Bench 77.2를 기록했습니다. 비교 대상으로는 Claude Opus 5, GPT-5.6 Sol, Claude Fable 5와 이전 버전인 MiMo-V2.5 Pro가 포함되어 있습니다.
실행 방법
제공된 SGLang 설정은 Docker 이미지 lmsysorg/sglang:latest를 기준으로 합니다. --tp 16, --dp 2, --ep 16을 사용하고, DeepEP 기반 MoE 통신과 data-parallel attention을 활성화합니다. 2개 노드에서 실행하며 --nnodes 2, --node-rank, --dist-init-addr를 지정합니다. 최대 동시 요청 수는 128, chunked prefill 크기는 32,768, page size는 64로 설정합니다. reasoning parser와 tool-call parser는 모두 mimo를 사용하고 포트는 30000으로 엽니다. Speculative decoding에는 EAGLE을 적용하며 3단계, draft token 4개, multi-layer EAGLE 옵션을 지정합니다.
vLLM에서는 vllm/vllm-openai:mimov25-cu129 이미지를 사용하도록 안내합니다. tensor parallel size는 8, GPU memory utilization은 0.95로 설정하며 최대 모델 길이는 auto로 둡니다. 자동 tool choice를 켜고 mimo reasoning parser와 tool-call parser를 지정합니다. 권장 sampling 값은 temperature 1.0, top_p 0.95입니다. 모델은 Hugging Face와 ModelScope에서 받을 수 있고, AI Studio, MiMo Code, Xiaomi MiMo Desktop, Xiaomi MiMo Open Platform API, OpenRouter에서도 제공됩니다.
원문: Hugging Face / 번역·요약: Trawling