ChronoBench: leaderboard

Metric: Overall accuracy (%; all 17,689 validated multiple-choice questions over remote-sensing image time series, box- and geo-coordinate-grounded variants; open models greedy with 128 new tokens, API models at high reasoning effort). Source: arxiv.org. Saturation forecast: Around September 2028. 11 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)56.29
2Qwen 3 VL 32B Instruct46.73
3Qwen 3 VL 8B Instruct39.19
4InternVL3.5-8B36.32
5Qwen 3 VL 4B Instruct35.1

Interactive version: theaggregate.ai/benchmark?slug=chronobench · How It Works · Data refreshed daily, snapshot 2026-09-29.