Open LMM Reasoning - WeMath - Understanding and Conversion of Units: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1GPT-4o ChatGPT95.6
2InternVL3-38B95.1
3Claude 3.5 Sonnet (20241022)94.4
4Doubao-1.5-Pro94.4
5GPT-4.1 (2025-04-14)94
6Gemini 1.5 Pro (002)92.9
7QVQ-72B-Preview91.7
8InternVL3-78B90.8
9Gemini 2.0 Flash88.7
10Claude 3.7 Sonnet87.8
11Gemma 3 12B87.6
12Gemma 3 27B87.1
13Qwen 2 VL 72B81
14VLAA-Thinker-Qwen2.5VL-3B81
15Grok 2 (1212)80.7

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-understanding-and-conversion-of-units · How It Works · Data refreshed daily, snapshot 2026-09-05.