AraGen — leaderboard

Arabic generative benchmark using the 3C3H metric (Correctness, Completeness, Conciseness, Helpfulness, Honesty, Harmlessness) to evaluate Arabic LLM capabilities across QA, grammar, reasoning, and safety tasks.

Metric: 3C3H Score (%). Source: huggingface.co. Status: saturation imminent. 69 models tracked.

Top models

#ModelScore
1O1 (2024-12-17)84.29
2GPT-584.25
3O3 (2025-04-16)82.19
4Claude Opus 4 (20250514)80.96
5Claude Opus 4.5 (20251101)80.29
6Claude Sonnet 4.578.17
7Claude 3.7 Sonnet (20250219)78.16
8Claude Sonnet 4 (20250514)75.58
9GPT-4.174.54
10Gemma 4 31B (IT)72.71
11O4 Mini (2025-04-16)70.6
12O1 Mini (2024-09-12)70.46
13Gemini 2.5 Pro (Preview 05-06)68.37
14Gemma 4 26B A4B (IT)67.35
15Claude Haiku 4.5 (20251001)65.8

Interactive version: theaggregate.ai/benchmark?slug=aragen · How the rankings work · Data refreshed daily, snapshot 2026-07-22.