Humanity's Last Exam (Self-Reported, With Tools): leaderboard
Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GLM-5.3 | 62.5 |
| 2 | Hy4 preview | 55.4 |
| 3 | GLM-5.3 Flash | 55.3 |
| 4 | GLM-5.2 | 54.7 |
| 5 | Kimi K2.6 | 54 |
| 6 | GLM-5.1 | 52.3 |
| 7 | GLM-5 | 50.4 |
| 8 | Kimi K2.5 | 50.2 |
| 9 | Qwen 3.5 27B | 48.5 |
| 10 | Qwen 3.5 397B A17B | 48.3 |
| 11 | Step 3.7 Flash | 48.1 |
| 12 | MiMo-V2.5-Pro | 48 |
| 13 | Qwen 3.5 122B A10B | 47.5 |
| 14 | Kimi K2 (Thinking) | 44.9 |
| 15 | GLM-4.7 | 42.8 |
Interactive version: theaggregate.ai/benchmark?slug=humanity-s-last-exam-self-reported-with-tools · How It Works · Data refreshed daily, snapshot 2026-09-05.