Open LMM Reasoning - WeMath - InsufficientKnowledge (Loose): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini97.7
2Llama 3.2 11B Instruct80
3Qwen 2 VL 2B65.9
4InternVL2.5-2B63.8
5Aquila-VL-2B54.9
6Qwen 2 VL 7B50.1
7InternVL2-8B47
8InternVL2.5-8B-BoN-845.9
9Gemma 3 4B43.6
10Gemma 3 12B39.6
11Taichu-VLR-3B38.9
12Qwen 2 VL 72B37.3
13URSA-8B37.3
14VLAA-Thinker-Qwen2.5VL-3B36.6
15VLM-R1-3B-Math-030536.2

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-insufficientknowledge-loose · How It Works · Data refreshed daily, snapshot 2026-09-05.