MiGUE-Bench - Intra-Document Temporal Relations: leaderboard

Metric: Accuracy (%) on 300 single-document temporal relation multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.571
2Qwen 3 Max69.67
3GLM-4.769.33
4Gemini 3 Pro68.67
5Claude Haiku 4.567.67
6DeepSeek V3.266
7GPT-5.2 Pro66
8Kimi K259
9Qwen 3 235B A22B56
10Qwen 3 30B A3B41
11Qwen 3 8B40

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-intra-document-temporal-relations · How It Works · Data refreshed daily, snapshot 2026-09-29.