Mistral7B-PairRM-SPPO-Iter3 — benchmark results

Provider: Mistral. Released 2024-05-04. Access: Open.

Unified ELO 1354 ± 18, rank #1399 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC60.84Accuracy (%)84.9
Open Korean LLM Leaderboard340.96Average Score (%)69.8
Open LLM Leaderboard - MuSR9.49Score46.2
Open LLM Leaderboard - IFEval43.51Score46
Open LLM Leaderboard - BBH21.82Score32.5
Open Chinese LLM - HellaSwag56.65Accuracy (%)30.3
Open LLM Leaderboard - GPQA3.36Score30.2
Open Chinese LLM - ARC Challenge47.44Accuracy (%)28.6
Open LLM Leaderboard - MMLU-Pro18.42Score28.1
Open Chinese LLM - WinoGrande60.85Accuracy (%)20.3
Open Chinese LLM - GSM8K24.11Accuracy (%)17.8
Open Chinese LLM Leaderboard49.34Average Score (%)17.5

Interactive version: theaggregate.ai/model?slug=mistral7b-pairrm-sppo-iter3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.