NEVU - Story-Based Composite Events: leaderboard

Metric: Micro-F1 (%) of directed Level-1 value labels for story-based composite event units on NEVU's sampled test subset; higher is better. Source: arxiv.org. Saturation forecast: Around March 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.545.68#79
2GPT-5.245.31#105
3Claude Sonnet 4.543.22#138
4Gemini 2.5 Pro43.04#145
5O342.6#121
6GPT-4.141.63#240
7Claude Haiku 4.539.69#271
8Ministral-3-8B-Instruct-251227.31#644
9Qwen 3 8B14.88#667
10Llama 3.1 8B Instruct11.4#1018
11Phi-3.5-mini-instruct10.02#1148

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=nevu-story-based-composite-events · How It Works · Data refreshed daily, snapshot 2026-10-11.