TemporalBench - FreshRetailNet T2: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1Single LLM (deepseek-chat)56.82
2TimeSeries Scientist (deepseek-chat)56.82
3TimeSeries Scientist (gpt-4o)56.82
4Single LLM (gpt-4o)52.27
5MetaGPT (deepseek-chat)41.67
6AgentScope (deepseek-chat)34.85
7TimeClaw (deepseek-v4-pro)31.06
8TimeCopilot (deepseek-v4-pro)23.81
9TimeCopilot (deepseek-chat)20.29
10AgentScope (gpt-4o)12.12

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-freshretailnet-t2 · How It Works · Data refreshed daily, snapshot 2026-09-05.