TemporalBench - MIMIC T1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1CAMEL (gpt-4o)46.81
2Single LLM (gpt-4o)46.81
3MetaGPT (gpt-4o)45.74
4TimeCopilot (deepseek-chat)45.74
5AgentScope (gpt-4o)44.68
6TimeCopilot (deepseek-v4-pro)35.64
7Single LLM (deepseek-chat)33
8AgentScope (deepseek-chat)32.98
9MetaGPT (deepseek-chat)32.98
10TimeClaw (deepseek-v4-pro)32.45

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-mimic-t1 · How It Works · Data refreshed daily, snapshot 2026-09-05.