Open LMM Reasoning - WeMath - Cutting and Combining of Figures: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro87.9
2Claude 3.7 Sonnet84.6
3GPT-4.1 (2025-04-14)82.8
4Gemini 2.0 Flash82.2
5InternVL3-38B79
6InternVL3-78B75.8
7GPT-4o ChatGPT75.3
8InternVL3-8B75.2
9Gemini 1.5 Pro (002)75
10Claude 3.5 Sonnet (20241022)73.7
11Qwen 2 VL 72B73.3
12Taichu-VLR-7B71.9
13QVQ-72B-Preview71.4
14VLAA-Thinker-Qwen2.5VL-7B71.4
15InternVL2.5-8B-BoN-871.3

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-cutting-and-combining-of-figures · How It Works · Data refreshed daily, snapshot 2026-09-05.