MiGUE-Bench - Causal Graph Induction: leaderboard

Metric: Accuracy (%) on 110 cross-document causal-path multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around October 2027. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.558.14
2GPT-5.2 Pro43.75
3DeepSeek V3.228.41
4GLM-4.727.27
5Qwen 3 Max27.27
6Kimi K226.14
7Qwen 3 30B A3B25
8Gemini 3 Pro21.59
9Claude Haiku 4.519.32
10Qwen 3 235B A22B17.05
11Qwen 3 8B13.64

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-causal-graph-induction · How It Works · Data refreshed daily, snapshot 2026-09-29.