Hacker News

MiMo-v2.6-Pro: Intelligence, Performance and Price Analysis

MiMo-V2.6-Pro: 지능·성능·가격 분석

Xiaomi의 오픈 웨이트 모델 MiMo-V2.6-Pro는 Artificial Analysis Intelligence Index에서 46점을 기록해 동급 중앙값 18점을 크게 웃돕니다. 1조 개 파라미터 중 추론 때 420억 개를 활성화하며, 100만 토큰 컨텍스트와 텍스트·이미지·음성·영상 입력을 지원합니다.

AI 요약

MiMo-V2.6-Pro는 Xiaomi가 만든 reasoning 기반 오픈 웨이트 모델입니다. Artificial Analysis 페이지에 따르면 2026년 9월 21일 출시됐으며 MIT 라이선스로 배포됩니다. 모델 가중치는 Hugging Face에서 받을 수 있습니다.

성능과 모델 구성

Artificial Analysis Intelligence Index에서 46점을 받아 동급 모델 중앙값 18점보다 높은 점수를 기록했습니다. 이 지수는 reasoning, 지식, 수학, 코딩을 함께 평가하는 종합 지표입니다. 페이지는 reasoning 모델을 reasoning·non-reasoning 모델과 함께 비교하고, 오픈 웨이트 모델은 파라미터 규모가 같은 모델끼리 비교한다고 설명합니다.

MiMo-V2.6-Pro는 전체 1조 개 파라미터를 가진 Mixture of Experts, MoE 모델입니다. 토큰 하나를 처리할 때 활성화하는 파라미터는 420억 개입니다. 입력은 텍스트, 이미지, 음성, 영상을 지원하고 출력은 텍스트만 지원합니다. 컨텍스트 윈도는 100만 토큰으로, 페이지는 12포인트 Arial 기준 약 1,500쪽 분량으로 환산합니다.

가격과 속도

Xiaomi API 기준 입력 가격은 100만 토큰당 0.43달러, 출력 가격은 0.87달러입니다. 캐시 적중 70%, 입력 20%, 출력 10% 비율을 적용한 혼합 가격은 100만 토큰당 0.18달러로 제시됩니다. 제공업체에 따라 가격은 달라질 수 있습니다.

출력 속도는 초당 124.5토큰으로, 동급 오픈 웨이트 모델 중앙값 74.8토큰보다 높습니다. 첫 토큰까지 걸리는 시간은 2.34초로 중앙값 2.33초와 비슷합니다. 다만 Artificial Analysis 본문은 입력 가격의 비교 중앙값을 0.30달러, FAQ는 0.45달러로 다르게 적습니다. 출력 가격의 비교 중앙값도 본문은 1.13달러, FAQ는 1.68달러로 제시합니다.

Intelligence Index 평가에서 생성한 출력은 1억 4,000만 토큰입니다. 페이지는 이를 중앙값보다 다소 장황하다고 설명하지만, 표시된 중앙값 역시 1억 4,000만 토큰입니다. 지수 평가 전체 비용은 206.66달러입니다.

커뮤니티에서 제기된 검증과 반응

Hacker News에서는 지수 구성과 페이지의 수치 표기를 두고 의견이 갈렸습니다. @jampekka는 1억 4,000만 토큰이 중앙값 1억 4,000만 토큰보다 많다는 설명을 그대로 인용하며 오류를 지적했습니다. 답글에서는 수치 템플릿을 자동으로 채우는 과정에서 생긴 규칙 기반 봇 오류 같다는 추측이 나왔습니다.

MiMo-V2.6-Pro의 46점이 DeepSeek-V4.1의 39점보다 높은 점수라는 비교도 논쟁이 됐습니다. Artificial Analysis의 가중치와 평가 구성이 자주 바뀌며, 장시간 agentic 작업 능력의 비중을 높이는 과정에서 세계 지식과 글쓰기 능력의 비중이 상대적으로 낮아졌다는 지적이 있었습니다. 반대로 모델의 실제 용도에 따라 어떤 벤치마크가 적합한지가 달라진다는 의견도 나왔습니다.

속도에 관해서는 평가가 엇갈렸습니다. 한 사용자는 자체 LLM 벤치마크인 KillSwitch-Bench 1.0에서 MiMo-V2.6-Pro가 DeepSeek보다 빠르지만 선두 모델보다 느렸다고 보고했습니다. 해당 테스트 점수는 Claude Opus 5 66.9, GPT-6 Astra 57.9, Claude Fable 5.1 46.7, MiMo-V2.6-Pro 38.8, Muse Spark 1.3 36.5였습니다. 다른 사용자는 수요에 따라 속도가 크게 달라지며 밤에는 초당 80토큰 이상을 기록했다고 답했습니다.

일부 사용자는 OpenAI 계열 서비스의 사용량 제한과 모델 품질 변화에 불만을 표시하며 중국계 모델을 시험하겠다고 했습니다. 반면 모델 지능이 실제로 하락했다는 주장에 객관적인 증거가 있는지 묻는 반박도 있었습니다. MiMo-V2.6-Pro는 UI 작업이 아닌 코딩에서는 초기 결과가 좋았다는 사용 경험도 공유됐습니다.

MiMo-V2.6의 학습 비용으로 Xiaomi가 347만 달러를 제시했다는 댓글도 있었습니다. 이에 대해 해당 금액은 전체 학습이 아니라 post-training 또는 RL 학습 비용만 가리킨다는 답변이 이어졌습니다.

Hacker News 반응

  • @jampekka — 지능 지수를 평가하는 동안 1억 4,000만 토큰을 생성했는데, 중앙값 1억 4,000만 토큰과 비교해 다소 장황했다고 합니다.
    • @throwa356262 — 요즘에는 이런 오류가 오히려 좋은 일일 수 있습니다 :) 사람이 낸 오류라는 뜻이니, 봇이 대충 조립한 결과는 아니기 때문입니다.
    • @jampekka — 제 추측으로는 봇 오류입니다. 다만 규칙 기반 봇 오류인 것 같습니다.
    • @theanonymousone — 숫자를 넣어 채우는 템플릿이 있는 것 같습니다. Grok 성능 페이지에서도 비슷한 문제가 발견됐습니다. https://news.ycombinator.com/item?id=49789558
  • @egeres — MiMo-V2.6 Pro가 지수에서 46점을 받고 DeepSeek-V4.1이 39점을 받은 점이 수상해 보입니다. Xiaomi의 부록을 보면 DeepSeek 모델이 때때로 MiMo를 앞서고, 능력 차이도 그렇게 크지 않습니다. 일주일 전에는 Opus 5가 Fable 5보다 1점 앞섰지만 Fable이 훨씬 더 똑똑한 모델이었고, 이 문제는 이미 수정됐습니다.
    • @GodelNumbering — MiMo-V2.6 Pro가 DeepSeek-V4.1보다 7점 높은 이유가 무엇인가요?
    • @SyneRyder — Artificial Analysis의 주요 벤치마크는 계속 바뀌고 있습니다. Astra가 해당 벤치마크에서 GPT 5.6 Sol보다 전혀 나아지지 않은 결과를 보인 뒤에는 크게 수정되기도 했습니다. Fable 5.0을 목록에 수동으로 다시 넣으면 Opus 5보다 아직 1점 앞서므로, 수정된 모델은 Fable 5.1뿐입니다. AA 벤치마크는 다른 벤치마크와 내부 벤치마크를 가중 평균한 값입니다. 어려운 부분은 자신이 모델을 사용하는 방식에 맞는 벤치마크를 찾는 일입니다.
    • @seahorseemoji — Artificial Analysis가 가중치를 계속 바꾸는 방식은 승자를 먼저 정한 뒤 그에 맞춰 가중치를 조정하는 것처럼 느껴집니다. 장시간 agentic 능력이 향상된 모델에 더 큰 비중을 주면서 세계 지식과 글쓰기 능력의 상대적 중요도를 낮추고 있습니다. 세계 지식이 그다지 중요하지 않을 수 있다는 점은 인정합니다. 하지만 사람이 이해하기 위한 글쓰기 능력은 중요합니다. 이상한 표현과 단어 선택은 연구소들이 사람의 이해를 덜 중요하게 본다는 점을 반영하는 것 같습니다.
  • @dom96 — 인상적인 모델입니다. 이 페이지에 적힌 내용 대부분에 동의하지만 빠르다는 평에는 동의하지 않습니다. 제 LLM 벤치마크 모음으로 실행해 보니 DeepSeek보다 빠르지만 선두 모델보다는 훨씬 느렸습니다. 다만 가격은 정말 강점입니다. KillSwitch-Bench 1.0에서 Claude Opus 5는 66.9, GPT-6 Astra는 57.9, Claude Fable 5.1은 46.7, MiMo-V2.6-Pro는 38.8, Muse Spark 1.3은 36.5였습니다. https://bench.killswitch-lang.org/
    • @ricardobeat — 속도는 수요에 따라 크게 달라지는 것 같습니다. 어젯밤에는 초당 80토큰 이상이 나왔습니다.
  • @Gareth321 — OpenAI 사용량 제한이 크게 줄었고 지능도 눈에 띄게 떨어진 것처럼 보여서, 이제 중국계 모델을 진지하게 시험하려고 합니다. 시간이 더 걸려도 괜찮습니다. 매일 같은 방식으로 예측 가능하게 작동하는 지능이 필요합니다.
    • @unsupp0rted — 저도 같습니다. Codex에 월 200달러를 내지만 예전에는 주간 한도로 일주일치 작업을 했고, 지금은 대략 1~2일밖에 못 씁니다. Astra는 전혀 사용하지 않고 Sol에서 Luna Xhigh를 조율하고 있지만, 주간 할당량만큼 일주일을 쓰기에는 여전히 부족합니다. 새 모델이 나오기 직전마다 사용 중인 모델이 크게 멍청해지는 느낌도 듭니다. 증거는 없고 앞으로도 가질 수 없겠지만, 지갑으로 판단할 수는 있습니다.
    • @Gareth321 — 강하게 동의합니다. Codex subreddit을 확인해 보세요. Astra가 모델을 조용히 낮춰 사용한다는 경험적 사례가 많습니다. 한 사용자는 Astra 비용을 내고도 실제로는 Luna Max를 쓰고 있다는 사실을 발견했습니다. Sol X/High를 계속 사용해도 Astra 출시 전보다 제한이 적어도 절반 수준입니다. 저는 100달러 요금제를 취소했습니다. 지금은 정말 터무니없고 쓸 수 없는 수준입니다.
    • @Muromec — 여기서 사람들이 쓰는 금액을 보면서 주당 10유로 정도로 DS를 쓰는 제 입장에서는 이상한 기분이 듭니다.
    • @Gareth321 — 이런 도구는 감당할 수 있으면 꽤 훌륭했지만, 지금은 비싸고 형편없습니다. 둘 다 갖추면 쓸 수 없습니다.
    • @phoghed — 지능이 눈에 띄게 떨어졌다는 말에 진지하게 묻고 싶습니다. 증거가 있나요? 2023년부터 계속 나오는 주장인데, 이를 추적하려는 사이트가 올라올 때마다 보면 그래프는 평평합니다.
    • @loloisi — 200달러 구독으로 쓰던 Sol 5.6 xhigh는 코딩에서 매우 안정적인 작업 도구였습니다. 하지만 이번 주에 시스템을 조정한 것 같고, 주간 한도에 근접하지도 않았는데 Astra, Sol, Luna 모두 계속 rate limit에 걸립니다. MiMo 2.6 Pro는 UI가 아닌 작업에서 초기 결과가 꽤 좋아서 당분간 비용을 이쪽으로 옮길 가능성이 큽니다.
  • @ignoramous — Xiaomi에 따르면 MiMo v2.6의 학습 비용은 347만 달러입니다. Big 5 업체인 MSL, xAI, GDM, OAI, Ant에 대한 1억 달러 이상의 추정치와는 큰 차이가 납니다. 급여와 R&D 비용도 비슷하게 크게 다르더라도 놀랍지 않습니다. 벤치마크에서 Muse Spark 1.3과 비슷한 모델인 MiMo v2.6 Pro는 매우 저렴합니다. 캐시 가격이 100만 토큰당 0.0036달러로 유지된다면 더 그렇습니다.
    • @NortySpock — 347만 달러는 post-training만 포함한다는 인상을 받았습니다. 일부 그래프가 0에서 시작하지 않기 때문입니다. 거의 학습하지 않은 모델이 DeepSWE v1.1에서 48점을 받을 수 있을까요? https://mimo.xiaomi.com/rl/
    • @imjonse — 그것은 RL 학습 비용만 가리킵니다. Xiaomi 발표 블로그에도 그렇게 적혀 있습니다. https://mimo.xiaomi.com/mimo-v2-6#scaling-rl-fully-open-sour...
    • @drbscl — 중국의 기술직 급여는 꽤 괜찮지만 샌프란시스코만큼 높지는 않고, 일반적인 유럽 급여에 더 가깝다고 이해하고 있습니다. 생활비가 더 낮기 때문이며 Shenzhen은 Silicon Valley보다 훨씬 저렴합니다.

원문: Artificial Analysis / 번역·요약: Trawling