BacktestBench: leaderboard

Metric: Overall Accuracy (OA) (self-reported). Source: benchmarklist.com. 23 models tracked.

Top models

#ModelScore
1Gemini 3 Pro67.41
2Qwen 3 Max61.84
3Seed 1.860.58
4GLM-4.756.83
5Qwen 3 235B A22B55.01
6DeepSeek V3.250.7
7GPT-OSS-120B49.56
8Qwen 3 32B47.81
9Qwen 3 30B A3B47.03
10MiniMax-M2.145.91
11Kimi K2 (Thinking)44.97
12Qwen 3 Next 80B A3B44.06
13Qwen 3 Coder Plus42.05
14MiMo-V2-Flash40.43
15Qwen 3 14B36.97

Interactive version: theaggregate.ai/benchmark?slug=backtestbench · How It Works · Data refreshed daily, snapshot 2026-09-05.