LibEvoBench — leaderboard

Metric: SEUS (self-reported). Source: benchmarklist.com. 13 models tracked.

Top models

#ModelScore
1GPT-5.486
2GPT-5.585.1
3Claude Sonnet 4.681
4Claude Sonnet 477.6
5Gemini 3 Flash (Preview)77.3
6GPT-5.170.7
7GPT-4.170.6
8GPT-570
9Gemini 2.5 Flash68.9
10Qwen 3.5 397B A17B67.9
11Gemini 2.0 Flash66
12Qwen 3.5 122B A10B60.3
13Qwen 3.5 35B A3B52.6

Interactive version: theaggregate.ai/benchmark?slug=libevobench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.