MiMo V2.5 Pro (Thinking): benchmark results
Provider: Xiaomi. Released 2026-04-23. Access: Open.
Unified ELO 1659 ± 1, rank #292 of 3078 rated models, from 74 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - jaster (2-shot) - JCommonsenseQA | 100 | Exact match (%) | 94.5 |
| Nejumi 4 - Toxicity - Fairness | 99.44 | Criteria met (%) | 93.8 |
| Nejumi 4 - jaster (2-shot) - JSQuAD | 81.56 | Character F1 (x100) | 93.8 |
| Nejumi 4 - MT-Bench (Japanese) - Coding | 100 | Judge rating (1-10, x10) | 91.5 |
| Nejumi 4 - jaster (0-shot) - JSQuAD | 81.23 | Character F1 (x100) | 91.2 |
| Wolfram LLM Benchmarking Project | 60.1 | Correct Functionality (%) | 88.1 |
| Nejumi 4 - jaster (2-shot) - JaMP | 80 | Exact match (%) | 87.9 |
| Nejumi 4 - jaster (2-shot) - JNLI | 90 | Exact match (%) | 84.9 |
| Nejumi 4 - MT-Bench (Japanese) - Roleplay | 98.5 | Judge rating (1-10, x10) | 83.8 |
| Nejumi 4 - BFCL - Live AST | 73.15 | Accuracy (%) | 82.4 |
| Nejumi 4 - jaster (0-shot) - JaNLI | 100 | Exact match (%) | 82.4 |
| Nejumi 4 - Toxicity - Social Norms | 97.62 | Criteria met (%) | 77.6 |
Interactive version: theaggregate.ai/model?slug=mimo-v2-5-pro-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.