Open LMM Reasoning - MathVerse - Volume — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 100 models tracked.

Top models

#ModelScore
1Doubao-1.5-Pro68.6
2Gemini 1.5 Pro (002)47.1
3Claude 3.7 Sonnet45.1
4InternVL3-78B43.1
5InternVL3-38B43.1
6GPT-4.1 Mini39.2
7GPT-4o ChatGPT39.2
8QVQ-72B-Preview39.2
9InternVL3-8B37.3
10Claude 3.5 Sonnet (20241022)37.3
11Gemini 2.0 Flash35.3
12GPT-4.1 (2025-04-14)33.3
13InternVL3-14B31.4
14Grok 2 (1212)31.4
15Gemma 3 4B29.4

Interactive version: theaggregate.ai/benchmark?slug=open-lmm-reasoning-mathverse-volume · How the rankings work · Data refreshed daily, snapshot 2026-07-22.