URIAL-Bench - Reasoning — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-49
2Llama 2 70B Base6.1
3Yi 34B (Base)6
4DBRX5.9
5GPT-3.5 Turbo5.65
6Mixtral 8x7B (v0.1)5.3
7Mistral-7B-v0.14.9
8Phi-24.55
9gemma-7B4.5
10Yi 6B (Base)3.5
11Llama 2 7B Base3.45
12Llama 2 13B Base2.9
13falcon-7B2.8
14gemma-2B2.55
15mpt-7B1.05

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.