MetroLLM-Bench: leaderboard

Metric: Composite score (238 held-out cases, higher is better). Source: continker.ai. 21 models tracked.

Top models

#ModelScore
1Muse Glimmer 30B92.03
2Qwen 3.8 27B91.83
3Qwen 3.6 27B91.28
4Qwen 3.5 27B90.6
5GPT-5.6 Luna (Medium)90.57
6GPT-5.4 (xHigh)90.45
7Qwen 3.5 35B A3B89.9
8GPT-5.6 Sol (xHigh)89.82
9GPT-5.4 (High)88.2
10Qwen 3.5 9B88.05
11Mistral Small 487.82
12GPT-5.4 (Medium)87.72
13Qwen 3.5 4B87.25
14GLM-4.7 Flash86.73
15GPT-5.4 Nano86.58

Interactive version: theaggregate.ai/benchmark?slug=metrollm-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.