Mistral7B-PairRM-SPPO-ExPO — benchmark results
Provider: Mistral. Released 2024-05-04. Access: Open.
Unified ELO 1337 ± 21, rank #1449 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 61.07 | Accuracy (%) | 86.4 |
| Open Korean LLM Leaderboard | 129.9 | Average Score (%) | 53.8 |
| Open LLM Leaderboard - MuSR | 8.66 | Score | 41.7 |
| Open LLM Leaderboard - IFEval | 36.73 | Score | 35.3 |
| Open Chinese LLM - ARC Challenge | 48.55 | Accuracy (%) | 35 |
| Open Chinese LLM - HellaSwag | 57.57 | Accuracy (%) | 33.5 |
| Open LLM Leaderboard - GPQA | 3.58 | Score | 31.9 |
| Open LLM Leaderboard - MMLU-Pro | 17.24 | Score | 26.3 |
| Open LLM Leaderboard - BBH | 13.68 | Score | 22.4 |
| Open Chinese LLM - WinoGrande | 60.62 | Accuracy (%) | 18.5 |
| Open Chinese LLM Leaderboard | 49.02 | Average Score (%) | 16.5 |
| Open Chinese LLM - GSM8K | 22.44 | Accuracy (%) | 15.1 |
Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.