Devstral Medium: benchmark results

Mistral's API-only mid-tier agentic coding model (July 2025, built with All Hands AI) scoring 61.6% on SWE-Bench Verified at Medium-3 pricing. Provider: Mistral. Released 2025-07-10. Access: API.

Unified ELO 1526 ± 1, rank #566 of 1392 rated models, from 49 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Dart20Accuracy (%)59.4
AA Omniscience - Software Engineering (SWE) - Julia12Accuracy (%)58
AA Omniscience - Software Engineering (SWE) - Java16Accuracy (%)57
AA Omniscience - Software Engineering (SWE) - Kotlin18Accuracy (%)55.3
AA Omniscience-31.57Score55.2
AA Omniscience - Software Engineering (SWE) - TypeScript18.89Accuracy (%)53.8
AA Omniscience - Humanities & Social Sciences21.2Accuracy (%)53.7
AA Omniscience - Software Engineering (SWE) - R10Accuracy (%)53.4
AA Omniscience - Software Engineering (SWE) - C32Accuracy (%)52.9
AA Omniscience - Software Engineering (SWE) - HTML30Accuracy (%)51.7
AA Omniscience - Health20.6Accuracy (%)51.3
AA Omniscience - Software Engineering (SWE) - Python18Accuracy (%)51.2

Interactive version: theaggregate.ai/model?slug=devstral-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.