TemporalBench - T1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1TimeCopilot (deepseek-chat)50
2Single LLM (gpt-4o)49.72
3CAMEL (gpt-4o)49.44
4Single LLM (deepseek-chat)49.44
5MetaGPT (deepseek-chat)49.16
6AgentScope (deepseek-chat)48.6
7MetaGPT (gpt-4o)48.6
8AgentScope (gpt-4o)48.18
9CAMEL (deepseek-chat)45.66
10TimeClaw (deepseek-v4-pro)42.72

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-t1 · How It Works · Data refreshed daily, snapshot 2026-09-05.