JustEval - Engagement — leaderboard

Metric: Score (1-5). Source: allenai.github.io. 16 models tracked.

Top models

#ModelScore
1Yi 34B (Chat)4.85
2Llama 2 70B Chat4.78
3Llama 2 70B Chat GPTQ4.75
4tulu-2-dpo-70B4.74
5Llama 2 7B Chat4.7
6tulu-2-dpo-7B4.69
7GPT-4 (0314)4.62
8GPT-4 (0613)4.61
9Yi 6B (Chat)4.61
10GPT-3.5 Turbo4.58
11Vicuna-7B4.51
12Mistral 7B Instruct4.47

Interactive version: theaggregate.ai/benchmark?slug=justeval-engagement · How the rankings work · Data refreshed daily, snapshot 2026-07-22.