NEVU - Subevent Level: leaderboard

Metric: Micro-F1 (%) of directed Level-1 value labels for subevent units on NEVU's sampled test subset; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.546.68#79
2Gemini 2.5 Pro45.49#145
3GPT-5.244.97#105
4Claude Sonnet 4.544.91#138
5O342.62#121
6GPT-4.141.67#240
7Claude Haiku 4.541.02#271
8Ministral-3-8B-Instruct-251226#644
9Qwen 3 8B13.67#667
10Llama 3.1 8B Instruct11.79#1018
11Phi-3.5-mini-instruct7.17#1148

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=nevu-subevent-level · How It Works · Data refreshed daily, snapshot 2026-10-11.