Magis-Bench — leaderboard

Metric: AVG (self-reported). Source: benchmarklist.com. 23 models tracked.

Top models

#ModelScore
1Gemini 3 Flash (Preview)6.67
2Claude Opus 4.56.46
3GPT-5.16.23
4Gemini 2.5 Pro6.18
5Claude Sonnet 4.55.55
6GPT-4.15.2
7DeepSeek V3.24.34
8Kimi K2 (Thinking)4.14
9GPT-5 Mini4.08
10GPT-4.1 Mini3.84
11Qwen 2.5 72B Instruct2.62
12Qwen 2.5 14B Instruct2.04
13Qwen 3 8B1.82

Interactive version: theaggregate.ai/benchmark?slug=magis-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.