MiGUE-Bench - Event Detection: leaderboard

Metric: Micro-F1 (%) on 330 event-trigger detection questions (multiple-choice questions with LLM-built distractors over news documents, several correct options); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 12 models tracked.

Top models

#ModelScore
1Claude Opus 4.585.52
2GPT-5.2 Pro83.98
3DeepSeek V3.281.68
4GLM-4.781.33
5Gemini 3 Pro71.51
6Qwen 3 Max65.43
7Qwen 3 30B A3B62.98
8Qwen 3 8B61.38
9Qwen 3 235B A22B61.15
10Claude Haiku 4.561.01
11Kimi K258.94

Interactive version: theaggregate.ai/benchmark?slug=migue-bench-event-detection · How It Works · Data refreshed daily, snapshot 2026-09-29.