BenchLM: leaderboard

Composite LLM leaderboard aggregating current model performance across agentic, coding, reasoning, grounded multimodal, knowledge, multilingual, instruction-following, and math categories.

Metric: Overall Score. Source: benchlm.ai. Status: years away from saturation. 200 models tracked.

Top models

#ModelScore
1Claude Fable 5.183
2GPT-681
3Claude Fable 580.9
4Claude Opus 580.7
5GPT-5.6 Sol79.7
6Gemini 3.8 Flash78.4
7Kimi K374.9
8GPT-5.573.3
9Qwen 3.8 Max72.4
10Claude Opus 4.872.3
11Muse Spark 1.271.9
12Muse Spark 1.171.8
13GPT-5.6 Terra71.4
14GPT-5.471
15Claude Sonnet 570.8

Interactive version: theaggregate.ai/benchmark?slug=benchlm · How It Works · Data refreshed daily, snapshot 2026-09-05.