LLM Stats (HMMT Feb 26): leaderboard

Metric: Score (%). Source: llm-stats.com. 12 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max97.1
2Claude Opus 4.6 (Thinking)96.2
3DeepSeek V4 Pro (Max)95.2
4DeepSeek V4 Pro (Reasoning, Max Effort)95.2
5DeepSeek V4 Flash (Max)94.8
6Qwen 3.7 Plus92.9
7Kimi K2.6 (Thinking)92.7
8GLM-5.292.5
9DeepSeek V4 Flash (0423)91.9
10GLM-5.1 (Thinking)89.4
11Qwen 3.6 Plus87.8
12Qwen 3.6 27B84.3
13Qwen 3.6 35B A3B83.6
14GLM-5.182.6

Interactive version: theaggregate.ai/benchmark?slug=llm-stats-hmmt-feb-26 · How It Works · Data refreshed daily, snapshot 2026-09-05.