Open LMM Reasoning - WeMath - Three-step(S3): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro70.9
2GPT-4.1 (2025-04-14)61.8
3Gemini 2.0 Flash60.6
4GPT-4o ChatGPT58.8
5Claude 3.7 Sonnet56.4
6Taichu-VLR-7B56.4
7Claude 3.5 Sonnet (20241022)54.5
8Gemini 1.5 Pro (002)53.9
9QVQ-72B-Preview53.9
10InternVL2.5-8B-BoN-853.9
11InternVL3-38B52.7
12InternVL3-78B50.3
13GPT-4.1 Nano49.1
14VLAA-Thinker-Qwen2.5VL-7B49.1
15VLAA-Thinker-Qwen2.5VL-3B48.5

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-three-step-s3 · How It Works · Data refreshed daily, snapshot 2026-09-05.