KyrgyzLLM-Bench - KyrgyzRC: leaderboard

Metric: Accuracy (%, zero-shot). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.594.75
2GPT-5.191.5
3Claude Haiku 4.5 (20251001)91
4Qwen 3 Max91
5Mistral Large 390.5
6DeepSeek V390
7Gemini 2.5 Flash88.5
8Mistral Medium 3.187
9Grok 4.1 Fast (Non-reasoning)85.75
10GigaChat 2 Max85.25
11GPT-5 Mini83.25
12Llama 3.1 8B Instruct75.2
13Qwen 3 8B71.8
14Gemma 3 4B (IT)70.2
15Qwen 2.5 7B Instruct70

Interactive version: theaggregate.ai/benchmark?slug=kyrgyzllm-bench-kyrgyzrc · How It Works · Data refreshed daily, snapshot 2026-09-19.