Mistral7B-PairRM-SPPO-Iter2: benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1417 ± 1, rank #1082 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.54Accuracy (%)84
Open Korean LLM Leaderboard36.18Average Score (%)53.1
Open LLM Leaderboard - IFEval44.46Score48.5
Open LLM Leaderboard - MuSR9.8Score48.2
Open LLM Leaderboard - GPQA5.15Score43.2
Open LLM Leaderboard - BBH22.48Score33.7
Open Chinese LLM - ARC Challenge47.7Accuracy (%)30.4
Open Chinese LLM - HellaSwag56.25Accuracy (%)29.1
Open LLM Leaderboard - MMLU-Pro18.63Score28.3
Open Chinese LLM - WinoGrande61.17Accuracy (%)23.4
Open Chinese LLM Leaderboard49.68Average Score (%)19.6
Open Chinese LLM - GSM8K26.54Accuracy (%)19.3

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-iter2 · How It Works · Data refreshed daily, snapshot 2026-09-05.