IndicKLAR (Sanskrit): leaderboard

Metric: Accuracy (%; relaxed prefix match of the answer to 2,619 factual queries in Sanskrit script, native-speaker verified; direct 3-shot prompting with English examples, greedy decoding). Source: arxiv.org. Saturation forecast: Estimated already saturated. 9 models tracked.

Top models

#ModelScore
1Gemma 3 12B (IT)69.5
2Qwen 2.5 14B Instruct51.7
3Llama 3.1 8B Instruct50.9
4Gemma 3 4B (IT)47
5Qwen 2.5 7B Instruct37.7
6Llama 3.2 3B Instruct31.2
7Llama 3.2 1B Instruct22.5
8Qwen 2.5 1.5B Instruct21.5
9Gemma 3 1B (IT)19

Interactive version: theaggregate.ai/benchmark?slug=indicklar-sanskrit · How It Works · Data refreshed daily, snapshot 2026-09-26.