Mistral7B-PairRM-SPPO-ExPO: benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1400 ± 1, rank #1132 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.07Accuracy (%)86.4
Open LLM Leaderboard - MuSR8.66Score41.7
Open LLM Leaderboard - IFEval36.73Score35.3
Open Chinese LLM - ARC Challenge48.55Accuracy (%)35
Open Chinese LLM - HellaSwag57.57Accuracy (%)33.5
Open LLM Leaderboard - GPQA3.58Score31.9
Open Korean LLM Leaderboard32.86Average Score (%)27
Open LLM Leaderboard - MMLU-Pro17.24Score26.3
Open LLM Leaderboard - BBH13.68Score22.4
Open Chinese LLM - WinoGrande60.62Accuracy (%)18.5
Open Chinese LLM Leaderboard49.02Average Score (%)16.5
Open Chinese LLM - GSM8K22.44Accuracy (%)15.1

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-expo · How It Works · Data refreshed daily, snapshot 2026-09-05.