MiGUE-Bench - Cross-Document Causal Relations: leaderboard

Metric: Accuracy (%) on 300 cross-document causal relation multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around March 2027. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.570.48
2GPT-5.2 Pro64.08
3DeepSeek V3.262.86
4Qwen 3 Max60
5Gemini 3 Pro55.71
6GLM-4.753.33
7Qwen 3 235B A22B52.86
8Kimi K251.43
9Qwen 3 30B A3B50.95
10Claude Haiku 4.542.38
11Qwen 3 8B33.9

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-cross-document-causal-relations · How It Works · Data refreshed daily, snapshot 2026-09-29.