MiGUE-Bench - Intra-Document Causal Relations: leaderboard

Metric: Accuracy (%) on 300 single-document causal relation multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around October 2027. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.567.78
2DeepSeek V3.266.3
3GPT-5.2 Pro63.73
4Gemini 3 Pro62.96
5GLM-4.761.67
6Qwen 3 Max60.37
7Claude Haiku 4.560
8Kimi K256.3
9Qwen 3 235B A22B54.81
10Qwen 3 30B A3B49.26
11Qwen 3 8B45.99

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-intra-document-causal-relations · How It Works · Data refreshed daily, snapshot 2026-09-29.