Open LMM Reasoning - WeMath - RoteMemorization (Loose): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini91.7
2Llama 3.2 11B Instruct36
3Qwen 2 VL 2B22.3
4InternVL2.5-2B19.3
5Aquila-VL-2B13.5
6Qwen 2 VL 7B12.5
7Gemma 3 4B10.3
8GPT-4.1 Nano7.8
9InternVL2.5-8B-BoN-87.8
10URSA-8B7.5
11VLM-R1-3B-Math-03057.5
12VLAA-Thinker-Qwen2.5VL-3B6.9
13Grok 2 (1212)6.5
14Gemma 3 12B6.2
15Taichu-VLR-3B5.8

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-rotememorization-loose · How It Works · Data refreshed daily, snapshot 2026-09-05.