TemporalBench - FreshRetailNet T3: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1TimeSeries Scientist (deepseek-chat)34.09
2TimeClaw (deepseek-v4-pro)21.02
3CAMEL (deepseek-chat)19.89
4Single LLM (deepseek-chat)16.85
5TimeCopilot (deepseek-chat)15.91
6AgentScope (gpt-4o)13.64
7TimeCopilot (deepseek-v4-pro)13.07
8CAMEL (gpt-4o)6.25
9AgentScope (deepseek-chat)5.68
10MetaGPT (deepseek-chat)5.11

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-freshretailnet-t3 · How It Works · Data refreshed daily, snapshot 2026-09-05.