Mistral7B-PairRM-SPPO-Iter2 — benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1363 ± 18, rank #1368 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.54Accuracy (%)84
Open Korean LLM Leaderboard327.86Average Score (%)68.5
Open LLM Leaderboard - IFEval44.46Score48.5
Open LLM Leaderboard - MuSR9.8Score48.2
Open LLM Leaderboard - GPQA5.15Score43.2
Open LLM Leaderboard - BBH22.48Score33.7
Open Chinese LLM - ARC Challenge47.7Accuracy (%)30.4
Open Chinese LLM - HellaSwag56.25Accuracy (%)29.1
Open LLM Leaderboard - MMLU-Pro18.63Score28.3
Open Chinese LLM - WinoGrande61.17Accuracy (%)23.4
Open Chinese LLM Leaderboard49.68Average Score (%)19.6
Open Chinese LLM - GSM8K26.54Accuracy (%)19.3

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-iter2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.