Open LMM Reasoning - WeMath - RoteMemorization (Strict): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini100
2InternVL2.5-2B81.9
3Llama 3.2 11B Instruct80
4Qwen 2 VL 2B75.4
5Aquila-VL-2B67.5
6InternVL2-8B65.1
7InternVL2.5-8B-BoN-858.5
8Qwen 2 VL 7B57.3
9VLM-R1-3B-Math-030553.8
10Gemma 3 4B53.7
11GPT-4.1 Nano50.6
12Taichu-VLR-3B50.4
13URSA-8B47.2
14VLAA-Thinker-Qwen2.5VL-3B45.8
15Gemma 3 12B42.5

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-rotememorization-strict · How It Works · Data refreshed daily, snapshot 2026-09-05.