TimeLitmus - Traffic Series-Side Counterfactual Pairs: leaderboard

Metric: Counterfactual pair correctness (%; both independently evaluated endpoints correct on 136 Traffic pairs whose pre-report traffic series is changed while the incident is kept; ten LLMs with deterministic decoding where available, invalid or unparsable outputs scored incorrect). Source: arxiv.org. Saturation forecast: Around 2039. 10 models tracked.

Top models

#ModelScore
1DeepSeek R1 052821.3
2Qwen 3.5 4B20.6
3DeepSeek V4 Flash18.4
4Qwen 3.5 9B16.9
5Qwen Plus16.9
6MiniMax-M311.8
7Claude Sonnet 4.611
8GPT-5.48.8
9Gemini 3.5 Flash8.8
10GLM-54.4

Interactive version: theaggregate.ai/benchmark?slug=timelitmus-traffic-series-side-counterfactual-pairs · How It Works · Data refreshed daily, snapshot 2026-09-26.