OPT-BENCH — leaderboard

Metric: EG (20 steps) (self-reported). Source: benchmarklist.com. 19 models tracked.

Top models

#ModelScore
1Grok 363
2GPT-4o (2024-08-06)61
3DeepSeek V3.1 (Thinking)60
4GPT-4.158
5Qwen 3 32B58
6Qwen 3 30B A3B54
7Claude 3.7 Sonnet53
8Gemini 2.0 Flash53
9Claude 3.5 Sonnet48
10Qwen 2.5 72B Instruct45
11Qwen 2.5 32B Instruct45
12Qwen 3 8B38
13Qwen 2.5 14B Instruct30
14Qwen 2.5 7B Instruct20
15Qwen 2.5 3B Instruct15

Interactive version: theaggregate.ai/benchmark?slug=opt-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.