MiGUE-Bench - Cross-Document Temporal Relations: leaderboard

Metric: Accuracy (%) on 300 cross-document temporal relation multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1Gemini 3 Pro79.67
2Claude Opus 4.577.81
3Qwen 3 Max70.67
4GLM-4.770.66
5GPT-5.2 Pro67.86
6DeepSeek V3.267.32
7Kimi K261.67
8Qwen 3 235B A22B55.67
9Qwen 3 30B A3B53.72
10Qwen 3 8B49
11Claude Haiku 4.546.33

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-cross-document-temporal-relations · How It Works · Data refreshed daily, snapshot 2026-09-29.