IslamicMMLU - Hadith Authenticity Grading: leaderboard

Metric: Accuracy (%) on IslamicMMLU's about 1,000 Hadith track questions on grading a hadith as authentic, good, weak or fabricated; four-option multiple choice in Arabic, zero-shot, temperature 0, answer letter only (10 new tokens), via each model's API; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 26 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 3 Flash82.9#93
2Gemini 3 Pro82.4#77
3GPT-5.179.1#131
4Gemini 2.5 Pro77.9#145
5GPT-4o76.7#333
6Claude Opus 4.576.3#79
7GPT-576.1#91
8GPT-5.275.8#105
9Gemini 2.5 Flash72.2#237
10GPT-4.171.1#240
11Claude Sonnet 4.568.9#138
12Claude 3.7 Sonnet65.5#241
13GPT-465.4#423
14Claude Haiku 4.559.4#271
15Llama 4 Maverick53.5#451

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=islamicmmlu-hadith-authenticity-grading · How It Works · Data refreshed daily, snapshot 2026-10-11.