Arabic IFEval — leaderboard

Arabic instruction-following evaluation testing prompt-level and instruction-level accuracy in Arabic, adapted from the IFEval benchmark.

Metric: Arabic Accuracy (%). Source: huggingface.co. Status: saturation imminent. 40 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet75.9
2GPT-4o (2024-08-06)74.4
3GPT-4o Mini (2024-07-18)71.4
4Claude 3.5 Haiku70.9
5Qwen 2.5 72B Instruct70.7
6Qwen 2.5 32B Instruct63.7
7Gemma 2 27B (IT)63.5
8aya-expanse-32B61.3
9c4ai-command-r7B-12-202460.8
10Llama 3.3 70B Instruct60.7
11Claude 3 Haiku59
12Gemma 2 9B (IT)56
13Llama 3.1 405B Instruct53.8
14aya-expanse-8B53.5
15Qwen 2.5 7B Instruct52.8

Interactive version: theaggregate.ai/benchmark?slug=arabic-ifeval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.