FINESSE-Bench: leaderboard

Metric: exam-like (self-reported). Source: benchmarklist.com. 31 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus87.76
2Claude Sonnet 4.687.63
3Kimi K2.587.4
4GLM-587.27
5GLM-4.786.39
6GPT-5.285.95
7Qwen 3.5 397B A17B84.43
8Qwen 3.5 27B84.35
9Qwen 3.5 35B A3B83.9
10Qwen 3 235B A22B 2507 (Thinking)83.81
11DeepSeek R1 052882.66
12Claude 3.7 Sonnet82.61
13MiniMax-M2.580.05
14Qwen 3 32B79.38
15Llama 4 Maverick78.49

Interactive version: theaggregate.ai/benchmark?slug=finesse-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.