BanglaWild (English Prompt): leaderboard

Metric: Character error rate (CER x100: character edit distance over Unicode code points after NFC normalization divided by the reference length, mean over the 1,014-image test split; not capped, so it can exceed 100 when a model emits long off-target output; zero-shot, temperature 0 or greedy, 150-token cap; English transcribe-only prompt P1, image only). Source: arxiv.org. Saturation forecast: Around June 2027. 18 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash14.08
2Qwen 3.5 9B20.38
3Qwen 3.5 35B A3B21.2
4Claude Sonnet 4.623.15
5Qwen 3.5 27B23.87
6Gemini 2.5 Pro24.85
7Llama 4 Maverick36.96
8GPT-5.4 Mini53.41
9Gemma 3 12B (IT)63.89
10Claude Haiku 4.590.47
11Gemma 3 4B (IT)134.82
12GPT-5.4 Nano246.95

Interactive version: theaggregate.ai/benchmark?slug=banglawild-english-prompt · How It Works · Data refreshed daily, snapshot 2026-09-26.