URIAL-Bench - Roleplay — leaderboard

Metric: Judge Score (0-10). Source: huggingface.co. 19 models tracked.

Top models

#ModelScore
1GPT-48.9
2GPT-3.5 Turbo8.4
3DBRX7.93
4Yi 34B (Base)7.75
5Mistral-7B-v0.17.65
6Llama 2 7B Base7.48
7Mixtral 8x7B (v0.1)7.4
8Llama 2 70B Base7.33
9Phi-27.2
10Yi 6B (Base)6.95
11Llama 2 13B Base6.63
12gemma-7B6.25
13gemma-2B5.7
14falcon-7B4.55
15mpt-7B1.9

Interactive version: theaggregate.ai/benchmark?slug=urial-bench-roleplay · How the rankings work · Data refreshed daily, snapshot 2026-07-22.