LogiScope-VQA - Overall: leaderboard

Metric: Micro-averaged accuracy (%). Source: arxiv.org. 20 models tracked.

Top models

#ModelScore
1GPT-5.571
2Claude Opus 4.770
3Qwen 3.5 Plus70
4GPT-5.469
5Gemini 3.1 Pro (Preview)68
6Qwen 3.7 Plus66
7Claude Sonnet 4.664
8Qwen 3 VL 235B A22B64
9Kimi K2.662
10GLM-5.253
11Kimi K2 (Thinking)49
12GLM-4.748
13MiniMax-M2.546
14MiniMax-M2.143

Interactive version: theaggregate.ai/benchmark?slug=logiscope-vqa-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.