SAGE: leaderboard

Grading of handwritten maths coursework (automata, linear algebra, PDEs, AP calculus) against instructor rubrics, where the model picks which point deductions apply; Vals AI; top model 56.1%.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturation imminent. 80 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (Max)56.1
2Claude Opus 4.8 (Max)54.79
3Kimi K354.26
4GPT-5.6 Sol (Max)52.56
5Qwen 3.8 27B (xHigh)52.4
6Claude Fable 5 (Max)51.89
7Gemini 3 Flash (Preview) (High)51.85
8Claude Opus 4.6 (Adaptive Reasoning, Max Effort)51.58
9GPT-5.5 (xHigh)51.53
10Qwen 3.8 Max51.25
11GPT-5.4 Mini (xHigh)50.81
12MiniMax-M350.57
13Kimi K2.650.22
14Gemini 3.5 Flash (High)49.88
15Kimi K2.5 (Thinking)49.87

Interactive version: theaggregate.ai/benchmark?slug=sage · How It Works · Data refreshed daily, snapshot 2026-09-05.