FilBench - Reading Comprehension: leaderboard

Metric: Category Score (%). Source: huggingface.co. 38 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)80.12
2Qwen 2.5 72B Instruct75.62
3Llama 4 Maverick Instruct FP872.99
4Llama 4 Scout Instruct70.86
5Qwen 2.5 32B Instruct70.59
6Qwen 3 8B67.3
7Qwen 3 14B66.11
8Qwen 3 32B65.48
9Mixtral 8x22B Instruct (v0.1)64.78
10Sailor2-20B-Chat63.03
11SeaLLMs-v3-7B-Chat62.47
12Ministral-8B-Instruct-241062.33
13Mixtral 8x7B Instruct (v0.1)60.95
14Qwen 2.5 7B Instruct60.47
15Qwen 2.5 14B Instruct59.95

Interactive version: theaggregate.ai/benchmark?slug=filbench-reading-comprehension · How It Works · Data refreshed daily, snapshot 2026-09-19.