SiT-Bench - Logic & Anomaly Detection: leaderboard

Metric: Accuracy (%; item-weighted over the category's subtasks). Source: arxiv.org. Saturation forecast: Around February 2028. 31 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)59.11
2GPT-4o45.33
3Qwen 3 VL 8B Instruct41.33
4Qwen 3 VL 32B Instruct40.22
5InternVL3-14B36.89
6Qwen 3 VL 4B Instruct35.56
7Qwen 2.5 VL 72B Instruct34.89
8Qwen 2.5 72B Instruct33.33
9Qwen 3 4B 2507 Instruct33.11
10Qwen 2.5 7B Instruct31.33
11InternVL3-8B30.22
12Qwen 3 8B (Non-reasoning)30
13Qwen 3 30B A3B 2507 Instruct29.11
14Qwen 2.5 3B Instruct27.11
15Qwen 3 4B (Non-reasoning)26.67

Interactive version: theaggregate.ai/benchmark?slug=sit-bench-logic-anomaly-detection · How It Works · Data refreshed daily, snapshot 2026-09-25.