URIAL-Bench - Extraction — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-49.38
2GPT-3.5 Turbo8.85
3Mistral-7B-v0.17.75
4Llama 2 70B Base7.7
5DBRX7.65
6Mixtral 8x7B (v0.1)7.05
7Yi 34B (Base)6.8
8gemma-7B6.25
9Llama 2 13B Base4.7
10Phi-24.45
11Llama 2 7B Base3.4
12gemma-2B3.1
13Yi 6B (Base)2.95
14falcon-7B2.75
15mpt-7B1.55

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-extraction · How the rankings work · Data refreshed daily, snapshot 2026-07-22.