NEVU: leaderboard

Metric: Micro-F1 (%) of predicted directed Level-1 value labels (54 values, aligned or contradicted) per unit-actor pair on NEVU's sampled test subset, all four unit levels pooled, shared prompt and actor-centric JSON output, long units handled map-reduce; higher is better. Source: arxiv.org. Saturation forecast: Around March 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Pro47.05#145
2Claude Opus 4.546.37#79
3Claude Sonnet 4.544.43#138
4GPT-5.243.96#105
5GPT-4.141.82#240
6Claude Haiku 4.540.87#271
7O340.56#121
8Ministral-3-8B-Instruct-251225.49#644
9Qwen 3 8B16.06#667
10Llama 3.1 8B Instruct12.97#1018
11Phi-3.5-mini-instruct10.56#1148

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=nevu · How It Works · Data refreshed daily, snapshot 2026-10-11.