RubricEval — leaderboard

Instruction-following evaluation framework for open-ended tasks using example-specific rubrics and scalable model grading.

Metric: Mean Score (1-5). Source: huggingface.co. Status: saturation imminent. 13 models tracked.

Top models

#ModelScore
1GPT-43.18
2GPT-4 Turbo3.1
3Gemini 1.5 Pro3.06
4Gemini 1.5 Flash2.98
5Llama 3 70B2.9
6Claude 3 Opus2.86
7Claude 3 Sonnet2.79
8Claude 3 Haiku2.73
9Gemini 1.0 Pro2.56
10Llama 3 8B2.56
11GPT-3.5 Turbo2.52
12gemma-7B2.14
13gemma-2B1.83

Interactive version: theaggregate.ai/benchmark?slug=rubriceval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.