BanglaWild (Bengali Prompt): leaderboard

Metric: Character error rate (CER x100: character edit distance over Unicode code points after NFC normalization divided by the reference length, mean over the 1,014-image test split; not capped, so it can exceed 100 when a model emits long off-target output; zero-shot, temperature 0 or greedy, 150-token cap; the same instruction in Bengali script, prompt P2, image only). Source: arxiv.org. Saturation forecast: Around May 2027. 18 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash15.6
2Claude Sonnet 4.618.46
3Qwen 3.5 35B A3B20.23
4Qwen 3.5 9B20.51
5Gemini 2.5 Pro21.65
6Qwen 3.5 27B23.45
7Llama 4 Maverick37.98
8GPT-5.4 Mini56.83
9Gemma 3 12B (IT)70.76
10Claude Haiku 4.582.17
11Gemma 3 4B (IT)119.64
12GPT-5.4 Nano192.8

Interactive version: theaggregate.ai/benchmark?slug=banglawild-bengali-prompt · How It Works · Data refreshed daily, snapshot 2026-09-26.