SiT-Bench: leaderboard

Metric: Accuracy (%; item-weighted over the 17 subtasks). Source: arxiv.org. Saturation forecast: Around 2028. 30 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)59.46
2Qwen 3 VL 32B Instruct45.9
3GPT-4o45.7
4Qwen 2.5 VL 72B Instruct45.45
5InternVL3-14B42.58
6Qwen 2.5 72B Instruct42.57
7Qwen 3 VL 8B Instruct42.1
8Qwen 3 VL 4B Instruct38.67
9InternVL3-8B38.42
10Qwen 3 8B (Non-reasoning)37.91
11DeepSeek V3.2 (Non-reasoning)37.06
12Qwen 3 4B 2507 Instruct36.59
13Qwen 3 30B A3B 2507 Instruct36.5
14Qwen 2.5 7B Instruct36.43
15Qwen 2.5 3B Instruct34.81

Interactive version: theaggregate.ai/benchmark?slug=sit-bench · How It Works · Data refreshed daily, snapshot 2026-09-25.