XiaomiMiMo/MiMo-V2.6-Flash-RL
MiMo-V2.6-Flash-RL, 자기 개선형 멀티모달 에이전트 모델
MiMo-V2.6-Flash-RL은 텍스트·이미지·비디오·오디오와 100만 토큰 컨텍스트를 지원하는 Sparse MoE 모델입니다. 여러 도메인을 한 번에 학습하는 비동기 RL과 그룹 단위 에이전트 평가를 결합했으며, 코드·에이전트·사이버보안 벤치마크 결과와 SGLang·vLLM 실행 방법을 함께 제공합니다.
- 주제
AI 요약
MiMo-V2.6-Flash-RL은 MiMo-V2.6 시리즈에서 성능과 추론 효율의 균형을 맞춘 체크포인트입니다. Xiaomi MiMo Team은 강화학습(Reinforcement Learning, RL) 계산량뿐 아니라 환경의 다양성과 채점기 계산량까지 함께 확장해 모델이 탐색과 피드백을 반복하며 능력 범위를 넓히는 구성을 제시합니다. 텍스트, 이미지, 비디오, 오디오를 하나의 모델에서 처리하고, 긴 저장소와 도구 실행 기록, 여러 세션에 걸친 에이전트 작업을 위해 최대 100만 토큰 컨텍스트를 지원합니다.
한 번의 혼합 RL 학습
학습은 코딩, 일반 에이전트, 비주얼 작업, 사이버보안 작업을 도메인별로 나누지 않고 하나의 혼합 RL 실행에 넣습니다. 여러 작업과 평가 하네스를 같은 배치에 섞어 도메인 사이의 전략이 서로 전달되도록 설계했습니다. 학습 중 보지 못한 하네스에도 전략이 이어지는 구성을 목표로 합니다.
정책 최적화에는 비동기 Group Relative Policy Optimization(GRPO)을 사용합니다. 한 단계마다 1,568개 프롬프트에서 각각 16개의 롤아웃을 생성하며, 업데이트 하나에 수십억 토큰이 들어갑니다. 단순한 성공·실패 보상만으로는 통과한 풀이 사이의 품질 차이를 구분하기 어렵다는 점을 반영해 채점 과정도 확장합니다.
Groupwise Reward Synthesis(GRS)는 서로 다른 롤아웃을 비교해 작업별 평가 기준을 오프라인에서 만들고, 평가 기준의 품질과 테스트 결과를 결합합니다. Groupwise Advantage Redistribution(GAR)은 각 그룹 안에서 통과한 궤적을 온라인으로 순위화한 뒤 더 나은 풀이에 어드밴티지를 더 크게 배분합니다. 모델 자체가 생성한 샘플을 서로 비교해 보상 신호를 만들기 때문에, 더 짧은 경로와 더 적은 토큰으로 작업을 해결하는 방향을 유도하는 자기 개선 루프를 구성합니다.
정렬 RL 단계에서는 모델이 잘못된 응답을 스스로 되짚고, 근거가 있는 다음 단계로 다시 쓰는 콜드 스타트를 사용합니다. 보상 해킹을 막기 위해 학습 과정에서 환경을 어렵게 만들고, 적대적 샘플을 걸러내며, 검증기를 교차 확인합니다.
MOPD2와 모델 구조
혼합 RL 이후에는 Multi-Prefix Multi-Teacher On-Policy Distillation(MOPD2)을 적용합니다. 자율적으로 생성한 학생 롤아웃과 prefix 조건부 단일 턴 롤아웃을 결합합니다. Teacher-Prefix와 SFT-Prefix를 사용하면 교사 궤적과 SFT 시연에서 과거 이력을 재사용하면서 이전 턴을 다시 생성하지 않고 의사결정 지점을 학습할 수 있습니다. 이 방식은 결과를 자동으로 검증하기 어려운 작업까지 학습 범위를 넓히는 데 쓰입니다.
모델은 총 309B 파라미터 중 15B를 활성화하는 Sparse Mixture of Experts(MoE) 구조입니다. Flash 구성은 총 48개 레이어로, Sliding Window Attention(SWA) 39개와 Global Attention(GA) 9개를 사용하며 hidden size는 4096입니다. 첫 번째 Transformer 블록은 전역 어텐션과 dense FFN을 사용합니다. 나머지 블록은 로컬 SWA와 GA를 교차 배치하고, 두 어텐션 모두 공유 expert 없이 Sparse MoE FFN을 사용합니다. 라우팅 expert는 256개이며 토큰마다 8개를 활성화합니다. SWA의 슬라이딩 윈도 크기는 128입니다.
비전 인코더는 28개 레이어와 681M 파라미터를 가진 MiMo ViT입니다. SWA 24개와 GA 4개로 구성되고 hidden size는 1280입니다. 패치 크기는 시간·높이·너비 기준 2 × 16 × 16이며, 공간 병합 크기는 2 × 2입니다. 오디오 입력에는 24개 레이어, 20개 RVQ 코드북을 사용하는 308M 파라미터 AudioTokenizer와 127M 파라미터 오디오 패치 인코더를 사용합니다. 오디오 패치 하나는 네 프레임을 묶어 25Hz 입력을 6.25Hz로 줄입니다.
5개 SWA 레이어로 구성한 Multi-Token Prediction(MTP) speculative decoder도 포함합니다. DFlash 계열 drafter가 한 번의 forward pass에서 뒤따르는 7개 토큰을 예측하고 병렬 검증을 진행합니다.
벤치마크 결과
모델 카드의 Flash 열에서 코드 에이전트 점수는 DeepSWE v1.1 67.9, ProgramBench 26.0, MiMo Code Bench 61.2입니다. 일반 에이전트 영역에서는 AutomationBench v1.0.6 52.3, Toolathlon-Verified 73.6, Agents’ Last Exam 27.6, Terminal Bench 4.0 28.8, Terminal Bench 2.1 87.6, OSWorld-Verified 80.8, JobBench 61.2를 기록했습니다. GDPval-AA 2.1의 Flash 점수는 표에 기재되지 않았습니다.
사이버보안 영역에서는 CyberGym 95.1, MiMo Cyber Bench 77.2, ExploitGym 6.0, ExploitBench 25.3, SEC Bench Pro 47.5입니다. MiMo VisualCoding 점수는 71.5입니다. 표에는 MiMo-V2.6-Pro-RL, MiMo-V2.5-Pro와 함께 Claude Opus 5, GPT-5.6 Sol, Claude Fable 5의 결과도 제시되어 있습니다.
실행 방법
모델 카드는 SGLang MiMo cookbook을 따르는 방식을 권장합니다. 제공된 예시는 SGLang Docker 이미지 lmsysorg/sglang:latest에서 tensor parallel 8, data parallel 2를 설정하고, data-parallel attention과 멀티모달 인코더 분산 처리를 활성화합니다. 정적 메모리 비율은 0.65, chunked prefill 크기는 16,384이며, EAGLE speculative decoding과 MiMo reasoning·tool-call parser를 사용합니다.
vLLM 실행 예시는 tensor parallel 4, --trust-remote-code, GPU 메모리 사용률 0.95, 자동 최대 컨텍스트 길이를 설정합니다. 안정 버전이 모델을 늦게 지원할 수 있어 vllm/vllm-openai:mimov25-cu129 사전 빌드 이미지를 안내합니다. 자동 도구 선택과 MiMo parser를 켜고, 권장 샘플링 값은 temperature 1.0, top_p 0.95입니다. AI Studio, MiMo Code, Xiaomi MiMo Desktop, Xiaomi MiMo Open Platform API, OpenRouter에서도 사용할 수 있습니다.
원문: Hugging Face / 번역·요약: Trawling