DORA - Temporal Evolution Reasoning: leaderboard

Metric: Final-answer accuracy (%; ReAct agent with tools). Source: github.com. Saturation forecast: Around December 2026. 13 models tracked.

Top models

#ModelScore
1MiMo-V2-Pro63.58
2Qwen 3.5 397B A17B61.83
3Gemma 4 31B61.03
4Gemini 3 Flash60.4
5Claude Sonnet 4.660.05
6Grok 4.1 Fast55.28
7GPT-5.451.9
8DeepSeek V3.250.62
9MiniMax-M2.750.59
10Step 3.5 Flash48.9
11GPT-5.4 Nano45.55
12Qwen 3.5 35B A3B37.62
13GPT-OSS-120B24.43

Interactive version: theaggregate.ai/benchmark?slug=dora-temporal-evolution-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-02.