SAHARA - Context-Based QA: leaderboard

Metric: Macro-F1 (%). Source: huggingface.co. 47 models tracked.

Top models

#ModelScore
1GPT-584.82
2GPT-5.182.81
3Gemma 2 27B (IT)82.49
4Qwen 3.6 27B81.57
5Qwen 3.6 35B A3B81.36
6Llama 4 Scout Instruct81.34
7Qwen 3.5 27B81.26
8Gemma 2 9B (IT)80.91
9c4ai-command-a-03-202580.05
10Gemini 2.5 Flash80.03
11Gemma 3 27B (IT)79.16
12Gemini 2.5 Pro79.03
13GPT-5.6 Luna78.3
14Llama 3.1 8B Instruct78.04
15Claude Sonnet 4 (20250514)78.02

Interactive version: theaggregate.ai/benchmark?slug=sahara-context-based-qa · How It Works · Data refreshed daily, snapshot 2026-09-19.