FilBench - Classical NLP: leaderboard

Metric: Category Score (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct90.27
2Qwen 2.5 32B Instruct89.32
3GPT-4o (2024-08-06)89.03
4Sailor2-20B-Chat89.03
5c4ai-command-a-03-202588.97
6Gemma 3 27B (IT)88.61
7Qwen 2.5 72B Instruct88.6
8Gemma 3 12B (IT)88.56
9gemma2-9B-cpt-sea-lionv3-instruct88.55
10Gemma 2 27B (IT)87.99
11Llama 4 Scout Instruct87.88
12Gemma 2 9B (IT)87.47
13aya-expanse-32B87.47
14Llama 4 Maverick Instruct FP887.28
15Qwen 3 32B87.26

Interactive version: theaggregate.ai/benchmark?slug=filbench-classical-nlp · How It Works · Data refreshed daily, snapshot 2026-09-19.