Open LMM Reasoning - WeMath - CompleteMastery (Strict) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro61.1
2GPT-4.1 (2025-04-14)49.7
3GPT-4o ChatGPT45.1
4Gemini 1.5 Pro (002)44
5Claude 3.7 Sonnet43.8
6InternVL3-38B43
7Gemini 2.0 Flash41
8InternVL3-78B40
9Claude 3.5 Sonnet (20241022)36.4
10InternVL3-14B35.4
11QVQ-72B-Preview34.1
12InternVL2.5-78B33.3
13Gemma 3 27B33.1
14Grok 2 (1212)31.8
15InternVL3-8B31.4

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-completemastery-strict · How the rankings work · Data refreshed daily, snapshot 2026-07-22.