Open LMM Reasoning - WeMath - Direction: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)96.4
2GPT-4o ChatGPT96.4
3Doubao-1.5-Pro96.4
4Grok 2 (1212)92.9
5Claude 3.7 Sonnet89.8
6InternVL3-78B89.5
7InternVL3-8B86.4
8Gemini 1.5 Pro (002)86.2
9InternVL2.5-78B86.2
10QVQ-72B-Preview85.7
11Gemini 2.0 Flash82.9
12Claude 3.5 Sonnet (20241022)82.6
13InternVL3-38B82.6
14Gemma 3 12B82.6
15VLAA-Thinker-Qwen2.5VL-7B82.4

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-direction · How It Works · Data refreshed daily, snapshot 2026-09-05.