FMG-Bench - Preference-Configured Harness: leaderboard

Metric: Judge-panel score (0-100; tradition preferences supplied). Source: github.com. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.794.66
2GPT-5.494.1
3Qwen 3.6 Plus94
4Kimi K2.693.21
5GLM-5.192.32
6DeepSeek V4 Pro92.13
7Grok 4.2092.11
8Gemini 3.1 Pro (Preview)91.78
9Nemotron 3 Super91.17
10MiMo-V2.5-Pro90.87
11Mistral Large 389.64
12MiniMax-M2.788.08
13Seed 2.0 Lite87.68
14Llama 4 Maverick80.37

Interactive version: theaggregate.ai/benchmark?slug=fmg-bench-preference-configured-harness · How It Works · Data refreshed daily, snapshot 2026-09-19.