SEAL - TutorBench — leaderboard

Metric: Score. Source: scale.com. 27 models tracked.

Top models

#ModelScore
1Muse Spark68.55
2GPT-5.4 Pro (xHigh)56.62
3Gemini 2.5 Pro (Preview 06-05)55.65
4GPT-555.33
5Kimi K2.554.56
6GPT-5.1 (Thinking)54.09
7Claude Opus 4.6 (Adaptive Reasoning, Max Effort)53.68
8Gemini 3 Pro (Preview)53.67
9Claude Opus 4.6 (Non-reasoning)53.55
10GPT-5.253.49
11Gemini 3.1 Pro (Preview)52.99
12O3 (2025-04-16) (Medium)52.76
13O3 (2025-04-16) (High)52.09
14Gemini 3.1 Flash Lite (Preview)51.5
15Claude Opus 4.5 (20251101) (Thinking)51.2

Interactive version: theaggregate.ai/benchmark?slug=seal-tutorbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.