Open LMM Reasoning - WeMath - Direction — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)96.4
2GPT-4o ChatGPT96.4
3Doubao-1.5-Pro96.4
4Grok 2 (1212)92.9
5Claude 3.7 Sonnet89.8
6InternVL3-78B89.5
7InternVL3-8B86.4
8InternVL3-14B86.4
9Gemini 1.5 Pro (002)86.2
10InternVL2.5-78B86.2
11QVQ-72B-Preview85.7
12Gemini 2.0 Flash82.9
13InternVL3-38B82.6
14Claude 3.5 Sonnet (20241022)82.6
15Gemma 3 12B82.6

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-direction · How the rankings work · Data refreshed daily, snapshot 2026-07-22.