Mistral Small 4 (Non-reasoning): benchmark results

Provider: Mistral. Released 2026-03-16. Access: Open.

Unified ELO 1484 ± 1, rank #1096 of 2032 rated models, from 56 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Java22.22Accuracy (%)80.2
AA Omniscience - Software Engineering (SWE) - R14.29Accuracy (%)70
AA Omniscience - Software Engineering (SWE) - Kotlin20Accuracy (%)63
AA Omniscience - Software Engineering (SWE) - Go18.75Accuracy (%)60.1
AA Omniscience - Software Engineering (SWE) - Python20.1Accuracy (%)58.9
AA-Omniscience Hallucination Rate78.01Hallucination Rate (%)55.2
AA-Omniscience Index - Software Engineering (SWE) - Java-42.42Omniscience Index55
AA Omniscience - Software Engineering (SWE) - Dart18Accuracy (%)51.5
AA Omniscience - Software Engineering (SWE) - TypeScript17.78Accuracy (%)51.4
AA CritPt0.29Accuracy (%)50.7
AA Omniscience - Software Engineering (SWE) - C30Accuracy (%)47.6
AA Omniscience - Software Engineering (SWE) - Julia8Accuracy (%)46.1

Interactive version: theaggregate.ai/model?slug=mistral-small-4-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-26.