HELM Arabic - Arabic Mmlu - Philosophy (High School): leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1ALLaM-7B-Instruct-preview82.05
2Claude Sonnet 4.676.92
3AceGPT-v2-70B-Chat76.92
4GPT-4.1 Mini74.36
5GPT-4.1 (2025-04-14)74.36
6Gemma 4 31B (IT)74.36
7Gemini 2.5 Flash Lite (Thinking)74.36
8Claude Opus 4.771.79
9Claude Haiku 4.5 (20251001)71.79
10DeepSeek V3.171.79
11Gemini 2.5 Flash (Thinking)71.79
12Qwen 2.5 72B Instruct69.23
13Qwen 3.5 397B A17B69.23
14Mistral Large 369.23
15jais-adapted-70B-chat69.23

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-arabic-mmlu-philosophy-high-school · How It Works · Data refreshed daily, snapshot 2026-09-19.