TemporalBench - CausalChambers T3: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1TimeClaw (deepseek-v4-pro)48.8
2CAMEL (deepseek-chat)46.8
3TimeCopilot (deepseek-v4-pro)46.8
4AgentScope (deepseek-chat)46.4
5MetaGPT (deepseek-chat)46.4
6MetaGPT (gpt-4o)45.2
7Single LLM (deepseek-chat)44.4
8AgentScope (gpt-4o)44
9CAMEL (gpt-4o)42
10TimeCopilot (deepseek-chat)40

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-causalchambers-t3 · How It Works · Data refreshed daily, snapshot 2026-09-05.