BacktestBench — leaderboard

Metric: Overall Accuracy (OA) (self-reported). Source: benchmarklist.com. 23 models tracked.

Top models

#ModelScore
1Seed 1.860.58
2GLM-4.756.83
3Qwen 3 235B A22B55.01
4DeepSeek V3.250.7
5GPT-OSS-120B49.56
6Qwen 3 32B47.81
7Qwen 3 30B A3B47.03
8MiniMax-M2.145.91
9Kimi K2 (Thinking)44.97
10Qwen 3 Next 80B A3B44.06
11Qwen 3 Coder Plus42.05
12MiMo-V2-Flash40.43
13Qwen 3 14B36.97
14GPT-OSS-20B33.13
15Ministral 3 14B26.98

Interactive version: theaggregate.ai/benchmark?slug=backtestbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.