VitaBench 2.0: leaderboard

Metric: Avg@4 Full Context (self-reported). Source: benchmarklist.com. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4.650.3
2Claude Opus 4.6 (Thinking)50.3
3Kimi K2.6 (Thinking)48.1
4DeepSeek V4 Pro45.6
5GLM-5.1 (Thinking)45
6GPT-544.1
7GPT-5 (Thinking)44.1
8Seed 2.0 Pro42.8
9GLM-5.142
10Claude Sonnet 4.541.7
11Claude Sonnet 4.5 (Thinking)41.7
12O340.3
13DeepSeek R1 052839.6
14Kimi K2.637.8
15GLM-4.5 (Thinking)36.9

Interactive version: theaggregate.ai/benchmark?slug=vitabench-2-0 · How It Works · Data refreshed daily, snapshot 2026-09-05.