FMG-Bench - Raw Model: leaderboard

Metric: Judge-panel score (0-100; no benchmark guidance). Source: github.com. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.792.33
2GPT-5.491.79
3Kimi K2.690.61
4Grok 4.2090.37
5Qwen 3.6 Plus89.93
6DeepSeek V4 Pro89.13
7GLM-5.188.89
8Gemini 3.1 Pro (Preview)87.72
9Nemotron 3 Super87.18
10MiMo-V2.5-Pro86.94
11MiniMax-M2.784.61
12Mistral Large 384.25
13Seed 2.0 Lite83.13
14Llama 4 Maverick73.51

Interactive version: theaggregate.ai/benchmark?slug=fmg-bench-raw-model · How It Works · Data refreshed daily, snapshot 2026-09-19.