Open LMM Reasoning - WeMath - InadequateGeneralization (Loose) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1InternVL3-8B16.2
2Gemma 3 4B15.6
3Claude 3.5 Sonnet (20241022)15.2
4Gemma 3 27B15.1
5Gemma 3 12B14.7
6Qwen 2 VL 72B13.7
7Qwen 2 VL 7B13.3
8Ovis2-8B13.3
9Gemini 1.5 Pro (002)12.9
10InternVL2.5-78B12.9
11Gemini 2.0 Flash12.9
12GPT-4.1 Nano12.8
13InternVL3-38B12.6
14Grok 2 (1212)12.6
15InternVL3-78B12.2

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-inadequategeneralization-loose · How the rankings work · Data refreshed daily, snapshot 2026-07-22.