LLM Stats (MCP-Mark): leaderboard

Metric: Score (%). Source: llm-stats.com. 8 models tracked.

Top models

#ModelScore
1Kimi K2.7 Code81.1
2Qwen 3.7 Max60.8
3Qwen 3.7 Plus58.7
4GLM-5.1 (Thinking)57.5
5DeepSeek V4 Pro (Reasoning, Max Effort)57.1
6Claude Opus 4.6 (Thinking)56.7
7Kimi K2.6 (Thinking)55.9
8Qwen 3.6 Plus48.2
9Qwen 3.5 397B A17B46.1
10DeepSeek V3.238
11Qwen 3.6 35B A3B37

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-mcp-mark · How It Works · Data refreshed daily, snapshot 2026-09-05.