Open LMM Reasoning - WeMath - RoteMemorization (Loose) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini91.7
2Llama 3.2 11B Instruct36
3Qwen 2 VL 2B22.3
4InternVL2.5-2B19.3
5Aquila-VL-2B13.5
6Qwen 2 VL 7B12.5
7Gemma 3 4B10.3
8GPT-4.1 Nano7.8
9Ovis2-8B7.4
10Grok 2 (1212)6.5
11Gemma 3 12B6.2
12Qwen 2 VL 72B5.5
13InternVL2-8B5
14InternVL3-8B4.3
15InternVL3-14B4.2

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-rotememorization-loose · How the rankings work · Data refreshed daily, snapshot 2026-07-22.