Mistral-Small-Instruct-2409 — benchmark results
Mistral's 22B dense instruct model with function calling and a 32K context, under the Mistral Research License (September 2024). Provider: Mistral. Released 2024-09-17. Access: Open.
Unified ELO 1539 ± 16, rank #650 of 1776 rated models, from 38 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MT-Bench PL - Humanities | 10 | Judge Score (0-10) | 94.9 |
| Polish EQ-Bench | 72.85 | EQ-Bench Score | 91.1 |
| HREF | 42.87 | Average HREF Score (%) | 87.9 |
| MT-Bench PL - Reasoning | 7.9 | Judge Score (0-10) | 82.7 |
| MT-Bench PL - STEM | 9.65 | Judge Score (0-10) | 82.7 |
| Open LLM Leaderboard - GPQA | 11.07 | Score | 81.7 |
| MT-Bench PL - Coding | 7.1 | Judge Score (0-10) | 81.6 |
| Open CoT - LogiQA 2 | 12.66 | CoT Gain (%) | 81.3 |
| Open CoT - LSAT Logical Reasoning | 17.06 | CoT Gain (%) | 80.2 |
| Open LLM Leaderboard - BBH | 40.56 | Score | 79.5 |
| Open LLM Leaderboard - IFEval | 66.7 | Score | 78.7 |
| Open PL LLM - Multiple Choice | 57.99 | Average Multiple-Choice Score (%) | 78.7 |
Interactive version: theaggregate.ai/model?slug=mistral-small-instruct-2409 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.