UrduMMLU (Urdu Prompt): leaderboard

Metric: Overall exact-match accuracy (%) on UrduMMLU's Urdu multiple-choice questions from Pakistani MCQ banks and public examinations, zero-shot, answer key parsed from the generation (unparsable, malformed or error outputs count as wrong); temperature 0 where available, 4,096 output tokens, Urdu instruction prompt. Source: arxiv.org. Saturation forecast: Around December 2026. 30 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash90.45
2Gemini 3.1 Flash Lite84.81
3GPT-5.484.32
4Claude Sonnet 4.683.07
5DeepSeek V4 Flash81.33
6Gemma 4 31B (IT)76.49
7Llama 4 Maverick Instruct75.93
8Qwen 3.6 35B A3B75.25
9GPT-5.4 Mini73.63
10Claude Haiku 4.572.52
11Gemma 4 26B A4B (IT)70.32
12Qwen 3.6 27B69.81
13Llama 4 Scout Instruct68.28
14Llama 3.3 70B Instruct67.1
15Ministral-3-8B-Instruct-251257.08

Interactive version: theaggregate.ai/benchmark?slug=urdummlu-urdu-prompt · How It Works · Data refreshed daily, snapshot 2026-09-29.