Open LMM Reasoning - WeMath - Cutting and Combining of Figures — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 83 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro87.9
2Claude 3.7 Sonnet84.6
3GPT-4.1 (2025-04-14)82.8
4Gemini 2.0 Flash82.2
5InternVL3-14B79.3
6InternVL3-38B79
7InternVL3-78B75.8
8GPT-4o ChatGPT75.3
9InternVL3-8B75.2
10Gemini 1.5 Pro (002)75
11Claude 3.5 Sonnet (20241022)73.7
12Qwen 2 VL 72B73.3
13QVQ-72B-Preview71.4
14InternVL2.5-78B70.3
15InternVL2-8B69.8

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-wemath-cutting-and-combining-of-figures · How the rankings work · Data refreshed daily, snapshot 2026-07-22.