Open LMM Reasoning - WeMath - Three-step(S3) — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro70.9
2GPT-4.1 (2025-04-14)61.8
3Gemini 2.0 Flash60.6
4GPT-4o ChatGPT58.8
5Claude 3.7 Sonnet56.4
6Claude 3.5 Sonnet (20241022)54.5
7Gemini 1.5 Pro (002)53.9
8QVQ-72B-Preview53.9
9InternVL3-38B52.7
10InternVL3-78B50.3
11InternVL3-14B49.7
12GPT-4.1 Nano49.1
13Grok 2 (1212)47.3
14InternVL3-8B46.7
15InternVL2.5-78B46.1

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-three-step-s3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.