HELM AFR - MMLU Clinical Knowledge (Amharic): leaderboard

Metric: EM. Source: crfm.stanford.edu. 22 models tracked.

Top models

#ModelScore
1Gemini 2.0 Flash83.02
2Claude 3.7 Sonnet (20250219)82.26
3Gemini 2.0 Flash Lite79.62
4DeepSeek V370.19
5Claude 3.5 Haiku (20241022)66.04
6Llama 3.1 70B Instruct57.36
7Qwen 2.5 72B Instruct55.85
8GPT-4o (2024-08-06)52.45
9Gemma 2 27B (IT)51.7
10GPT-4o Mini (2024-07-18)44.91
11Gemma 2 9B (IT)38.11
12Llama 3.1 8B Instruct34.72
13GPT-3.5 Turbo (0125)34.72
14GPT-4 Turbo33.96
15Mistral 7B Instruct (v0.3)31.7

Interactive version: theaggregate.ai/benchmark?slug=helm-afr-mmlu-clinical-knowledge-amharic · How It Works · Data refreshed daily, snapshot 2026-09-08.