MiGUE-Bench - Temporal Ordering (Start): leaderboard

Metric: Accuracy (%) of the event-start ordering over 150 multi-document event sets (output a full permutation); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.587.42
2GPT-5.2 Pro84.12
3DeepSeek V3.282.11
4GLM-4.780.67
5Gemini 3 Pro66.23
6Claude Haiku 4.544.37
7Qwen 3 Max44.37
8Kimi K235.76
9Qwen 3 235B A22B35.1
10Qwen 3 30B A3B17.22
11Qwen 3 8B13.91

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-temporal-ordering-start · How It Works · Data refreshed daily, snapshot 2026-09-29.