JustEval - Clarity — leaderboard

Metric: Score (1-5). Source: allenai.github.io. 16 models tracked.

Top models

#ModelScore
1GPT-4 (0613)4.99
2GPT-4 (0314)4.99
3GPT-3.5 Turbo4.98
4Yi 34B (Chat)4.97
5Llama 2 70B Chat4.95
6tulu-2-dpo-70B4.95
7Llama 2 70B Chat GPTQ4.92
8tulu-2-dpo-7B4.92
9Mistral 7B Instruct4.87
10Yi 6B (Chat)4.85
11Vicuna-7B4.85
12Llama 2 7B Chat4.83

Interactive version: theaggregate.ai/benchmark?slug=justeval-clarity · How the rankings work · Data refreshed daily, snapshot 2026-07-22.