TemporalBench - T2: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1TimeClaw (deepseek-v4-pro)38.22
2AgentScope (deepseek-chat)31.37
3Single LLM (deepseek-chat)30.19
4CAMEL (deepseek-chat)29.85
5Single LLM (gpt-4o)29.84
6MetaGPT (gpt-4o)27.33
7AgentScope (gpt-4o)26.53
8TimeSeries Scientist (deepseek-chat)26.53
9TimeSeries Scientist (gpt-4o)26.53
10CAMEL (gpt-4o)26.18

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-t2 · How It Works · Data refreshed daily, snapshot 2026-09-05.