Mistral7B-PairRM-SPPO-ExPO — benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1337 ± 21, rank #1449 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.07Accuracy (%)86.4
Open Korean LLM Leaderboard129.9Average Score (%)53.8
Open LLM Leaderboard - MuSR8.66Score41.7
Open LLM Leaderboard - IFEval36.73Score35.3
Open Chinese LLM - ARC Challenge48.55Accuracy (%)35
Open Chinese LLM - HellaSwag57.57Accuracy (%)33.5
Open LLM Leaderboard - GPQA3.58Score31.9
Open LLM Leaderboard - MMLU-Pro17.24Score26.3
Open LLM Leaderboard - BBH13.68Score22.4
Open Chinese LLM - WinoGrande60.62Accuracy (%)18.5
Open Chinese LLM Leaderboard49.02Average Score (%)16.5
Open Chinese LLM - GSM8K22.44Accuracy (%)15.1

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.