BhashaBench - Ayur - English: leaderboard
Metric: Accuracy (%). Source: huggingface.co. 31 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4o | 62.75 |
| 2 | Qwen 3 235B A22B 2507 Instruct | 60.25 |
| 3 | GPT-OSS-120B | 55.62 |
| 4 | DeepSeek V3.1 | 51.38 |
| 5 | Gemma 2 27B | 50.7 |
| 6 | Gemma 2 9B | 48.16 |
| 7 | Pangea-7B | 40.69 |
| 8 | Qwen 2.5 3B | 40.61 |
| 9 | Gemma 2 27B (IT) | 40.45 |
| 10 | GPT-OSS-20B | 38.3 |
| 11 | Indic-gemma-7B-finetuned-sft-Navarasa-2.0 | 37.12 |
| 12 | Llama 3.1 8B Instruct | 36.86 |
| 13 | Gemma 2 2B | 36.8 |
| 14 | Gemma 2 9B (IT) | 36.22 |
| 15 | Llama 3.1 8B | 35.48 |
Interactive version: theaggregate.ai/benchmark?slug=bhashabench-ayur-english · How It Works · Data refreshed daily, snapshot 2026-09-19.