TimeLitmus - Finance Series-Side Counterfactual Pairs: leaderboard

Metric: Counterfactual pair correctness (%; both independently evaluated endpoints correct on 300 Finance pairs whose pre-event series is changed while the event is kept; ten LLMs with deterministic decoding where available, invalid or unparsable outputs scored incorrect). Source: arxiv.org. Saturation forecast: Around 2035. 10 models tracked.

Top models

#ModelScore
1DeepSeek R1 052813.7
2GLM-511.3
3MiniMax-M311
4Claude Sonnet 4.69.7
5Qwen 3.5 4B9.3
6DeepSeek V4 Flash8
7Gemini 3.5 Flash7
8Qwen Plus4.3
9Qwen 3.5 9B3.7
10GPT-5.43

Interactive version: theaggregate.ai/benchmark?slug=timelitmus-finance-series-side-counterfactual-pairs · How It Works · Data refreshed daily, snapshot 2026-09-26.