HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Nutrition: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.792.16
2GPT-5.4 (2026-03-05)88.56
3Qwen 3.5 397B A17B88.24
4Claude Sonnet 4.687.25
5GPT-4.1 (2025-04-14)85.62
6Gemma 4 31B (IT)83.66
7Mistral Large 383.66
8Gemini 2.5 Flash (Thinking)83.33
9Claude Haiku 4.5 (20251001)81.7
10GPT-4.1 Mini81.37
11Llama 4 Maverick Instruct FP881.05
12Qwen 3 Next 80B A3B Instruct79.08
13Gemini 2.5 Flash Lite (Thinking)79.08
14Mistral Large 2 (Nov) Instruct (2411)78.43
15AceGPT-v2-70B-Chat77.78

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-nutrition · How It Works · Data refreshed daily, snapshot 2026-09-19.