MiMo-V2-Omni: benchmark results

Xiaomi's omni-modal MiMo-V2 model unifying text, vision, and speech in one backbone. Provider: Xiaomi. Released 2026-03-18. Access: API.

Unified ELO 1623 ± 1, rank #196 of 1392 rated models, from 60 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Video-MME-v247.1Avg Accuracy w/o sub (%)87.8
AA TAU-2 Bench91.23Accuracy (%)86.1
Chatbot Arena (Text - Multi-Turn)1451Arena Score81
BenchmarkList ECI133.61Capability Index (ECI)80.5
AA Terminal-Bench Hard34.85Accuracy (%)80.3
Artificial Analysis Intelligence Index28.1Intelligence Index78.5
Chatbot Arena (Text - Instruction Following)1427Arena Score78.4
Chatbot Arena (Text - Longer Query)1448Arena Score78.4
AA Long Context Reasoning75Accuracy (%)78.1
Chatbot Arena (Text - Coding)1486Arena Score78
Chatbot Arena (Text - Chinese)1478Arena Score77.8
Chatbot Arena (Text - Math)1436Arena Score77.7

Interactive version: theaggregate.ai/model?slug=mimo-v2-omni · How It Works · Data refreshed daily, snapshot 2026-09-05.