LLM Stats (Include): leaderboard

Metric: Score (%). Source: llm-stats.com. 31 models tracked.

Top models

#ModelScore
1Claude Opus 4.887.6
2Claude Opus 4.6 (Thinking)87.4
3Qwen 3.7 Max86.2
4DeepSeek V4 Pro (Reasoning, Max Effort)86.1
5Qwen 3.5 397B A17B85.6
6Qwen 3.6 Plus85.1
7GLM-5.1 (Thinking)84.3
8Kimi K2.6 (Thinking)84.2
9Qwen 3.7 Plus83
10Qwen 3.5 122B A10B82.8
11Qwen 3.5 27B81.6
12Qwen 3 235B A22B 2507 (Thinking)81
13Qwen 3 VL 235B A22B (Thinking)80
14Qwen 3 VL 235B A22B Instruct80
15Qwen 3.5 35B A3B79.7

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-include · How It Works · Data refreshed daily, snapshot 2026-09-05.