NEVU - Article Level: leaderboard

Metric: Micro-F1 (%) of directed Level-1 value labels for article-level units on NEVU's sampled test subset; higher is better. Source: arxiv.org. Saturation forecast: Around April 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Pro53.36#145
2Claude Opus 4.547.76#79
3Claude Sonnet 4.546.37#138
4Claude Haiku 4.543.05#271
5GPT-4.142.71#240
6GPT-5.242.48#105
7O337.98#121
8Ministral-3-8B-Instruct-251223.67#644
9Qwen 3 8B18.83#667
10Llama 3.1 8B Instruct15.19#1018
11Phi-3.5-mini-instruct13.31#1148

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=nevu-article-level · How It Works · Data refreshed daily, snapshot 2026-10-11.