NEVU - Behavior-Based Composite Events: leaderboard

Metric: Micro-F1 (%) of directed Level-1 value labels for behavior-based composite event units on NEVU's sampled test subset; higher is better. Source: arxiv.org. Saturation forecast: Around April 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1Claude Opus 4.544.47#79
2GPT-5.244.38#105
3Gemini 2.5 Pro42.66#145
4Claude Sonnet 4.542.17#138
5O341.48#121
6GPT-4.140.55#240
7Claude Haiku 4.538.38#271
8Ministral-3-8B-Instruct-251226.27#644
9Qwen 3 8B14.88#667
10Llama 3.1 8B Instruct11.29#1018
11Phi-3.5-mini-instruct9.04#1148

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=nevu-behavior-based-composite-events · How It Works · Data refreshed daily, snapshot 2026-10-11.