URIAL-Bench - Overall — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-48.99
2GPT-3.5 Turbo7.94
3DBRX7.22
4Llama 2 70B Base7.11
5Mixtral 8x7B (v0.1)6.94
6Mistral-7B-v0.16.68
7Yi 34B (Base)6.68
8gemma-7B6
9Phi-25.85
10Llama 2 13B Base5.34
11Yi 6B (Base)4.97
12Llama 2 7B Base4.83
13gemma-2B3.97
14falcon-7B3.1
15mpt-7B1.49

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-overall · How the rankings work · Data refreshed daily, snapshot 2026-07-22.