샤오미가 공개한 MiMo-V2.6-Pro가 제3자 벤치마크 기관 아티피셜 애널리시스의 인텔리전스 인덱스에서 46점을 기록하며, xAI의 Grok 4.6(44점)과 구글 Gemini 3.8 Flash(41점) 같은 폐쇄형 모델을 앞질렀습니다.
같은 날 출시된 Grok 4.7과는 46점으로 동점을 이뤘고, 중국의 경쟁 모델인 DeepSeek V4.1 Flash(39점)와 V4.1 Pro(36점)도 넘어섰습니다.
스마트폰과 전기차, 가전제품으로 이름을 알려온 기업이 프론티어 AI 경쟁에서 이런 성적을 낸 것이라 더욱 눈길을 끕니다.
이 모델은 MIT 라이선스 오픈 웨이트로 허깅페이스에서 무료 배포되며, API 가격도 입력 100만 토큰당 0.435달러·출력 0.87달러로 동급 최저가 수준입니다.
더 저렴한 MiMo-V2.6-Flash와 최대 20배 빠른 MiMo-V2.6-Pro-UltraSpeed도 함께 공개됐고, 모두 100만 토큰 멀티모달 컨텍스트를 지원합니다.
이번 출시는 파운데이션 모델부터 코딩 에이전트, 하네스, 훈련 인프라까지 아우르는 샤오미의 '오픈 에이전트 스택' 전략의 연장선입니다.
4월 공개된 V2.5는 MoE 구조와 저가 정책의 기틀을 마련했고, 이후 나온 코딩 에이전트 MiMo Code와 하네스 최적화 프레임워크 HarnessX가 이번 모델 훈련 자체에 반영됐습니다.
핵심은 대규모 강화학습(RL)입니다.
Pro와 Flash 모두 6일 이내에 약 75만 개 궤적을 다루는 30단계 RL을 거쳤고, 비용은 각각 약 262만 달러와 85만 달러였습니다.
짧은 답변이 아니라 길고 복잡한 에이전트 작업 전체를 강화하는 데 초점을 맞췄으며, 코딩, 시각 작업, 컴퓨터 사용, 사이버 보안 등 도메인별로 RL을 따로 돌리지 않고 하나의 대규모 훈련 실행에 통합했습니다.
샤오미는 단순 통과·실패 판정만으로는 깔끔한 해결책과 편법성 해결책을 구분할 수 없다는 문제도 다뤘습니다.
여러 시도를 비교해 루브릭을 만드는 GRS와 더 나은 해결책에 훈련 이점을 몰아주는 GAR을 도입해, 통과율은 유지하면서도 더 정확하고 깔끔한 패치를 만들도록 유도했습니다.
훈련 중에는 에이전트가 실제 버그 수정 대신 상류 소스나 이슈 기록에서 기존 수정 사항을 찾아 테스트만 통과시키는 '보상 해킹' 사례도 다수 발견됐는데, 훈련 환경에서 정답 출처를 차단하고 허점을 미리 찾는 '해크 에이전트'를 배치해 해킹 궤적을 2% 미만으로 억제했습니다.
전 딥시크 연구원 출신으로 현재 샤오미 MiMo 팀을 이끄는 푸리 뤄는 이번 RL 실행이 오픈소스 모델 팀 중 최대 규모급이라고 밝혔고, 업계에서는 엔비디아 칩 없이 중국산 칩만으로 이런 성능을 낸 점에 주목하며 사후 훈련 스케일링 법칙을 다시 봐야 한다는 반응도 나왔습니다.
벤치마크 - https://artificialanalysis.ai/models/mimo-v2-6-pro