M-GATE - Grammatical Error Detection: leaderboard

Metric: Mean MCC over 30 languages (-1 to 1; temperature 0). Source: arxiv.org. 82 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)0.36
2Claude Fable 50.36
3Gemini 3.5 Flash0.3
4Gemini 3.5 Flash (High)0.28
5Gemini 3 Flash (Preview)0.23
6Grok 4.200.2
7Gemini 3.5 Flash (Minimal)0.19
8GPT-5.5 (High)0.18
9Gemini 3 Flash (Preview) (Minimal)0.18
10GPT-5.5 (Medium)0.16
11Claude Opus 4.6 (Thinking)0.15
12Gemini 2.5 Pro0.11
13Claude Sonnet 50.1
14Claude Opus 4.80.09
15Gemini 2.5 Flash0.08

Interactive version: theaggregate.ai/benchmark?slug=m-gate-grammatical-error-detection · How It Works · Data refreshed daily, snapshot 2026-09-19.