HELM Reasoning - Aime25: leaderboard
Metric: Acc. Source: crfm.stanford.edu. 11 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5 Mini (2025-08-07) | 83.33 |
| 2 | Qwen 3 4B | 63.33 |
| 3 | Qwen 3 8B | 60 |
| 4 | Qwen 3 1.7B | 33.33 |
| 5 | Qwen 3 0.6B | 10 |
Interactive version: theaggregate.ai/benchmark?slug=helm-reasoning-aime25 · How It Works · Data refreshed daily, snapshot 2026-09-08.