URIAL-Bench - Humanities — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-49.95
2Llama 2 70B Base9.75
3GPT-3.5 Turbo9.55
4DBRX9.32
5Mixtral 8x7B (v0.1)9.2
6Mistral-7B-v0.19.07
7Phi-28.85
8gemma-7B8.82
9Yi 6B (Base)8.78
10Yi 34B (Base)8.48
11Llama 2 13B Base8.3
12Llama 2 7B Base8.07
13gemma-2B5.65
14falcon-7B4.4
15mpt-7B1.75

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-humanities · How the rankings work · Data refreshed daily, snapshot 2026-07-22.