OI-Bench - Standard Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1GPT-589.43
2Gemini 2.5 Pro87.66
3DeepSeek R186.92
4Qwen 3 235B A22B84.26
5DeepSeek V3.283.94
6Llama 4 Maverick82.07
7Claude Haiku 4.579.84
8Grok 4.178.08
9Llama 4 Scout78.05
10GPT-5 Mini76.08
11Gemini 2.5 Flash Lite69.57
12Qwen 3 8B69.3

Interactive version: theaggregate.ai/benchmark?slug=oi-bench-standard-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-25.