TutorBench — leaderboard

TutorBench evaluates how well LLMs perform common tutoring tasks for high school and AP-level subjects.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 23 models tracked.

Top models

#ModelScore
1Muse Spark68.55
2GPT-5.4 Pro (xHigh)56.62
3Gemini 2.5 Pro (Preview 06-05)55.65
4GPT-555.33
5O3 Pro54.62
6GPT-5.154.09
7Claude Opus 4.6 (Max)53.68
8GPT-5.253.49
9Gemini 3.1 Pro (Preview)52.99
10O3 (2025-04-16) (Medium)52.76
11O3 (2025-04-16) (High)52.09
12Gemini 3.1 Flash Lite (Preview)51.5
13Claude Opus 4.551.2
14Claude Opus 4.150.78
15Claude Opus 449.71

Interactive version: theaggregate.ai/benchmark?slug=tutorbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.