ChronosBench - Complex Scenes (Guided Prompt): leaderboard

Metric: Task Completion Rate (%; equal-weight mean of positive and negative branches, 54 complex cases, basic prompt plus guidance, thinking disabled). Source: arxiv.org. Saturation forecast: Estimated already saturated. 7 models tracked.

Top models

#ModelScore
1Claude Sonnet 4 (Non-reasoning)72.22
2GPT-4.161.11
3Qwen 3 8B (Non-reasoning)16.67
4Llama 3.1 8B Instruct11.11
5Qwen 3 32B (Non-reasoning)11.11

Interactive version: theaggregate.ai/benchmark?slug=chronosbench-complex-scenes-guided-prompt · How It Works · Data refreshed daily, snapshot 2026-09-25.