Open LMM Reasoning - WeMath - CompleteMastery (Strict): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro61.1
2GPT-4.1 (2025-04-14)49.7
3GPT-4o ChatGPT45.1
4Gemini 1.5 Pro (002)44
5Claude 3.7 Sonnet43.8
6InternVL3-38B43
7Gemini 2.0 Flash41
8InternVL3-78B40
9Taichu-VLR-7B37.9
10Claude 3.5 Sonnet (20241022)36.4
11VLAA-Thinker-Qwen2.5VL-7B34.3
12QVQ-72B-Preview34.1
13InternVL2.5-78B33.3
14Gemma 3 27B33.1
15InternVL2.5-8B-BoN-832.2

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-completemastery-strict · How It Works · Data refreshed daily, snapshot 2026-09-05.