HELM Arabic - Mbzuai Human Translated Arabic Mmlu - Logical Fallacies: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.784.66
2Claude Sonnet 4.683.44
3Gemma 4 31B (IT)82.21
4Gemini 2.5 Flash (Thinking)82.21
5Qwen 3.5 397B A17B80.98
6GPT-5.4 (2026-03-05)80.98
7Claude Haiku 4.5 (20251001)79.75
8GPT-4.1 (2025-04-14)79.14
9Mistral Large 379.14
10Qwen 2.5 72B Instruct77.3
11Gemini 2.5 Flash Lite (Thinking)76.07
12Qwen 3 Next 80B A3B Instruct75.46
13Llama 4 Maverick Instruct FP874.23
14Llama 3.3 70B Instruct73.01
15GPT-4.1 Mini71.17

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-mbzuai-human-translated-arabic-mmlu-logical-fallacies · How It Works · Data refreshed daily, snapshot 2026-09-19.