TemporalBench - FreshRetailNet T1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 13 models tracked.

Top models

#ModelScore
1AgentScope (deepseek-chat)70.45
2MetaGPT (deepseek-chat)69.89
3Single LLM (deepseek-chat)68.18
4CAMEL (deepseek-chat)67.05
5CAMEL (gpt-4o)64.2
6Single LLM (gpt-4o)63.64
7AgentScope (gpt-4o)62.5
8MetaGPT (gpt-4o)62.5
9TimeCopilot (deepseek-v4-pro)59.09
10TimeClaw (deepseek-v4-pro)56.25

Interactive version: theaggregate.ai/benchmark?slug=temporalbench-freshretailnet-t1 · How It Works · Data refreshed daily, snapshot 2026-09-05.