MiGUE-Bench - Cross-Document Subevent Relations: leaderboard

Metric: Accuracy (%) on 300 cross-document subevent relation multiple-choice questions with LLM-built distractors over news documents; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1DeepSeek V3.284.8
2Claude Opus 4.584.21
3Qwen 3 235B A22B83.62
4GLM-4.783
5GPT-5.2 Pro81.88
6Qwen 3 Max80.99
7Gemini 3 Pro80.34
8Qwen 3 30B A3B78.95
9Kimi K278.07
10Claude Haiku 4.571.64
11Qwen 3 8B61.7

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-cross-document-subevent-relations · How It Works · Data refreshed daily, snapshot 2026-09-29.