Mistral Small 4 (Non-reasoning): benchmark results
Provider: Mistral. Released 2026-03-16. Access: Open.
Unified ELO 1484 ± 1, rank #1096 of 2032 rated models, from 56 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Java | 22.22 | Accuracy (%) | 80.2 |
| AA Omniscience - Software Engineering (SWE) - R | 14.29 | Accuracy (%) | 70 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 20 | Accuracy (%) | 63 |
| AA Omniscience - Software Engineering (SWE) - Go | 18.75 | Accuracy (%) | 60.1 |
| AA Omniscience - Software Engineering (SWE) - Python | 20.1 | Accuracy (%) | 58.9 |
| AA-Omniscience Hallucination Rate | 78.01 | Hallucination Rate (%) | 55.2 |
| AA-Omniscience Index - Software Engineering (SWE) - Java | -42.42 | Omniscience Index | 55 |
| AA Omniscience - Software Engineering (SWE) - Dart | 18 | Accuracy (%) | 51.5 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 17.78 | Accuracy (%) | 51.4 |
| AA CritPt | 0.29 | Accuracy (%) | 50.7 |
| AA Omniscience - Software Engineering (SWE) - C | 30 | Accuracy (%) | 47.6 |
| AA Omniscience - Software Engineering (SWE) - Julia | 8 | Accuracy (%) | 46.1 |
Interactive version: theaggregate.ai/model?slug=mistral-small-4-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-26.