FINESSE-Bench — leaderboard

Metric: exam-like (self-reported). Source: benchmarklist.com. 31 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.687.63
2GLM-587.27
3GLM-4.786.39
4GPT-5.285.95
5Qwen 3.5 397B A17B84.43
6Qwen 3.5 27B84.35
7qwen3.5-flash84.08
8Qwen 3.5 35B A3B83.9
9DeepSeek R1 052882.66
10Claude 3.7 Sonnet82.61
11MiniMax-M2.580.05
12Qwen 3 32B79.38
13Llama 4 Maverick78.49
14MiniMax-M2.177.12
15Qwen 3.5 9B76.28

Interactive version: theaggregate.ai/benchmark?slug=finesse-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.