MiMo-V2-Omni: benchmark results
Xiaomi's omni-modal MiMo-V2 model unifying text, vision, and speech in one backbone. Provider: Xiaomi. Released 2026-03-18. Access: API.
Unified ELO 1623 ± 1, rank #196 of 1392 rated models, from 60 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Video-MME-v2 | 47.1 | Avg Accuracy w/o sub (%) | 87.8 |
| AA TAU-2 Bench | 91.23 | Accuracy (%) | 86.1 |
| Chatbot Arena (Text - Multi-Turn) | 1451 | Arena Score | 81 |
| BenchmarkList ECI | 133.61 | Capability Index (ECI) | 80.5 |
| AA Terminal-Bench Hard | 34.85 | Accuracy (%) | 80.3 |
| Artificial Analysis Intelligence Index | 28.1 | Intelligence Index | 78.5 |
| Chatbot Arena (Text - Instruction Following) | 1427 | Arena Score | 78.4 |
| Chatbot Arena (Text - Longer Query) | 1448 | Arena Score | 78.4 |
| AA Long Context Reasoning | 75 | Accuracy (%) | 78.1 |
| Chatbot Arena (Text - Coding) | 1486 | Arena Score | 78 |
| Chatbot Arena (Text - Chinese) | 1478 | Arena Score | 77.8 |
| Chatbot Arena (Text - Math) | 1436 | Arena Score | 77.7 |
Interactive version: theaggregate.ai/model?slug=mimo-v2-omni · How It Works · Data refreshed daily, snapshot 2026-09-05.