AfroBench: leaderboard

64 African languages across 15 NLP tasks and 22 datasets (understanding, text generation, knowledge and question answering, math reasoning), from McGill NLP and Masakhane (2025); average score.

Metric: Average Score (%). Source: huggingface.co. Status: saturation imminent. 24 models tracked.

Top models

#ModelScore
1GPT-577.74
2Gemini 3 Pro76.01
3Gemini 2.5 Pro74.53
4Claude Sonnet 4.570.6
5Claude Sonnet 468.7
6Gemini 2.5 Flash66.71
7Gemini 2.0 Flash66.43
8GPT-4o (2024-08-06)65.8
9GPT-4.165.7
10Gemini 1.5 Pro62.8
11Claude 3.7 Sonnet60.3
12Gemma 3 27B51.01
13Gemma 2 27B44.9
14Gemma 2 9B40.8
15Llama 3.1 70B40

Interactive version: theaggregate.ai/benchmark?slug=afrobench · How It Works · Data refreshed daily, snapshot 2026-09-05.