MiGUE-Bench - Temporal Ordering (End): leaderboard

Metric: Accuracy (%) of the event-end ordering over 150 multi-document event sets (output a full permutation); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro83.33
2Claude Opus 4.580.79
3DeepSeek V3.263
4GLM-4.756
5Gemini 3 Pro37.75
6Kimi K219.87
7Qwen 3 Max19.87
8Claude Haiku 4.517.22
9Qwen 3 235B A22B12.58
10Qwen 3 8B7.95
11Qwen 3 30B A3B5.3

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-temporal-ordering-end · How It Works · Data refreshed daily, snapshot 2026-09-29.