HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Virology: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.655.42
2Claude Haiku 4.5 (20251001)53.61
3Qwen 3.5 397B A17B53.61
4Claude Opus 4.752.41
5Qwen 3 Next 80B A3B Instruct52.41
6GPT-5.4 (2026-03-05)52.41
7GPT-4.1 (2025-04-14)51.81
8AceGPT-v2-70B-Chat51.2
9Qwen 2.5 72B Instruct50.6
10Gemma 4 31B (IT)50
11Llama 4 Maverick Instruct FP850
12DeepSeek V3.150
13Gemini 2.5 Flash Lite (Thinking)50
14jais-adapted-70B-chat50
15Mistral Large 349.4

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-virology · How It Works · Data refreshed daily, snapshot 2026-09-19.