Open LMM Reasoning - WeMath - InsufficientKnowledge (Loose) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini97.7
2Llama 3.2 11B Instruct80
3Qwen 2 VL 2B65.9
4InternVL2.5-2B63.8
5Aquila-VL-2B54.9
6Qwen 2 VL 7B50.1
7InternVL2-8B47
8Gemma 3 4B43.6
9Ovis2-8B40.4
10Gemma 3 12B39.6
11Qwen 2 VL 72B37.3
12GPT-4.1 Nano36
13Grok 2 (1212)34.7
14InternVL2.5-78B32.8
15QVQ-72B-Preview32.8

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-insufficientknowledge-loose · How the rankings work · Data refreshed daily, snapshot 2026-07-22.