Open LMM Reasoning - WeMath - Understanding and Conversion of Units — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4o ChatGPT95.6
2InternVL3-38B95.1
3Claude 3.5 Sonnet (20241022)94.4
4Doubao-1.5-Pro94.4
5GPT-4.1 (2025-04-14)94
6Gemini 1.5 Pro (002)92.9
7QVQ-72B-Preview91.7
8InternVL3-78B90.8
9InternVL3-14B88.7
10Gemini 2.0 Flash88.7
11Claude 3.7 Sonnet87.8
12Gemma 3 12B87.6
13Gemma 3 27B87.1
14Qwen 2 VL 72B81
15Grok 2 (1212)80.7

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-understanding-and-conversion-of-units · How the rankings work · Data refreshed daily, snapshot 2026-07-22.