SAHARA - Reading Comprehension: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 47 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)58.89
2Gemini 2.5 Pro55.92
3GPT-551.01
4GPT-5.6 Luna51
5GPT-5.150.24
6Gemini 2.5 Flash48.01
7Claude Sonnet 442.33
8GPT-4.139.7
9Qwen 3.6 35B A3B39.44
10Qwen 3.5 27B37.57
11Qwen 3.6 27B36.96
12Claude Sonnet 4 (20250514)36.6
13Llama 3.3 70B Instruct35.92
14DeepSeek R1 Distill Llama 70B33.72
15DeepSeek R1 Distill Qwen 32B33.64

Interactive version: theaggregate.ai/benchmark?slug=sahara-reading-comprehension · How It Works · Data refreshed daily, snapshot 2026-09-19.