HELM Arabic - Arabic Mmlu - Computer Science (University): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)85.94
2Claude Opus 4.785.94
3Claude Sonnet 4.684.38
4Gemma 4 31B (IT)84.38
5GPT-5.4 (2026-03-05)84.38
6Llama 4 Scout Instruct82.81
7Qwen 3.5 397B A17B82.81
8Gemini 2.5 Flash (Thinking)82.81
9Llama 3.3 70B Instruct81.25
10Qwen 3 Next 80B A3B Instruct81.25
11Mistral Large 381.25
12GPT-4.1 Mini79.69
13AceGPT-v2-70B-Chat79.69
14Qwen 2.5 72B Instruct78.12
15DeepSeek V3.178.12

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-computer-science-university · How It Works · Data refreshed daily, snapshot 2026-09-19.