Mistral7B-PairRM-SPPO-Iter3: benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1413 ± 1, rank #1090 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.84Accuracy (%)84.9
Open Korean LLM Leaderboard35.98Average Score (%)51.8
Open LLM Leaderboard - MuSR9.49Score46.2
Open LLM Leaderboard - IFEval43.51Score46
Open LLM Leaderboard - BBH21.82Score32.5
Open Chinese LLM - HellaSwag56.65Accuracy (%)30.3
Open LLM Leaderboard - GPQA3.36Score30.3
Open Chinese LLM - ARC Challenge47.44Accuracy (%)28.6
Open LLM Leaderboard - MMLU-Pro18.42Score28.1
Open Chinese LLM - WinoGrande60.85Accuracy (%)20.3
Open Chinese LLM - GSM8K24.11Accuracy (%)17.8
Open Chinese LLM Leaderboard49.34Average Score (%)17.5

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-iter3 · How It Works · Data refreshed daily, snapshot 2026-09-05.