MiGUE-Bench - Cross-Document Coreference: leaderboard

Metric: Accuracy (%) on 300 cross-document event coreference questions (2 options); higher is better. Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1GPT-5.2 Pro96.36
2Claude Opus 4.593.33
3Gemini 3 Pro91
4GLM-4.786
5DeepSeek V3.285.67
6Kimi K284
7Qwen 3 Max77
8Qwen 3 235B A22B76.67
9Claude Haiku 4.574
10Qwen 3 8B73.33
11Qwen 3 30B A3B62

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-cross-document-coreference · How It Works · Data refreshed daily, snapshot 2026-09-29.