URIAL-Bench - Coding — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-48.55
2GPT-3.5 Turbo6.9
3Mixtral 8x7B (v0.1)5.3
4DBRX4.7
5Mistral-7B-v0.14.6
6Phi-24.25
7Llama 2 70B Base4.15
8gemma-7B3.95
9Yi 34B (Base)3.85
10Llama 2 13B Base2.8
11Yi 6B (Base)2.3
12gemma-2B1.8
13Llama 2 7B Base1.65
14falcon-7B1.55
15mpt-7B1

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-coding · How the rankings work · Data refreshed daily, snapshot 2026-07-22.