MUSE — leaderboard

Metric: Final Score (self-reported). Source: benchmarklist.com. 15 models tracked.

Top models

#ModelScore
1GPT-5.567.14
2Gemini 3.1 Pro (Preview)53.93
3Claude Opus 4.753.46
4GLM-5.124.06
5Claude 3.7 Sonnet17.92
6Qwen 2.5 72B Instruct10.38
7Qwen 3.5 122B A10B10.38
8GPT-4o8.81
9MiniMax-M2.78.18
10Llama 3.1 70B5.5
11MiniMax-M2.55.35
12Qwen 3.6 35B A3B4.72
13GLM-4.7 Flash2.83
14Llama 3.1 8B0

Interactive version: theaggregate.ai/benchmark?slug=muse · How the rankings work · Data refreshed daily, snapshot 2026-07-22.