Magis-Bench: leaderboard

Metric: AVG (self-reported). Source: benchmarklist.com. 23 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)6.97
2Gemini 3 Flash (Preview)6.67
3Claude Opus 4.56.46
4GPT-5.16.23
5Gemini 2.5 Pro6.18
6Claude Sonnet 4.55.55
7GPT-4.15.2
8DeepSeek V3.24.34
9Kimi K2.54.17
10Kimi K2 (Thinking)4.14
11GPT-5 Mini4.08
12Qwen 3 235B A22B (Thinking)4
13GPT-4.1 Mini3.84
14Qwen 2.5 72B Instruct2.62
15Qwen 2.5 14B Instruct2.04

Interactive version: theaggregate.ai/benchmark?slug=magis-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.