KyrgyzLLM-Bench - KyrgyzMMLU: leaderboard

Metric: Accuracy (%, zero-shot). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.566.78
2DeepSeek V364
3Mistral Large 361.44
4GPT-5.159.56
5Qwen 3 Max59.56
6Claude Haiku 4.5 (20251001)59.11
7GigaChat 2 Max57.33
8Mistral Medium 3.153.56
9GPT-5 Mini50.11
10Gemini 2.5 Flash50
11Grok 4.1 Fast (Non-reasoning)48.56
12Qwen 3 8B32.1
13Qwen 2.5 7B Instruct31.5
14Llama 3.1 8B Instruct31
15Gemma 3 4B (IT)30.3

Interactive version: theaggregate.ai/benchmark?slug=kyrgyzllm-bench-kyrgyzmmlu · How It Works · Data refreshed daily, snapshot 2026-09-19.