TemporalBench - FreshRetailNet T4: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1TimeSeries Scientist (deepseek-chat)56.82
2TimeSeries Scientist (gpt-4o)56.82
3TimeClaw (deepseek-v4-pro)43.94
4AgentScope (deepseek-chat)42.42
5TimeCopilot (deepseek-chat)38.1
6MetaGPT (deepseek-chat)37.12
7CAMEL (gpt-4o)31.06
8CAMEL (deepseek-chat)29.55
9Single LLM (deepseek-chat)26.52
10AgentScope (gpt-4o)18.94

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-freshretailnet-t4 · How It Works · Data refreshed daily, snapshot 2026-09-05.