URIAL-Bench - Writing — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-49.65
2Llama 2 70B Base9.5
3GPT-3.5 Turbo9.2
4Mixtral 8x7B (v0.1)8.2
5DBRX7.93
6Yi 34B (Base)7.9
7Mistral-7B-v0.17.75
8Llama 2 13B Base7.53
9Phi-26.7
10gemma-7B6.65
11Llama 2 7B Base6.2
12Yi 6B (Base)5.1
13gemma-2B3.95
14falcon-7B2.7
15mpt-7B1.45

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-writing · How the rankings work · Data refreshed daily, snapshot 2026-07-22.