Can Large Language Models Handle Discourse Par — leaderboard

Metric: Overall Avg (MS) (self-reported). Source: benchmarklist.com. 10 models tracked.

Top models

#ModelScore
1GPT-572.4
2Gemini 3.1 Flash70.1
3DeepSeek V4 Flash69.8
4DeepSeek V4 Pro69.6
5Gemini 3.1 Pro (Preview)69.1
6Claude Sonnet 4.664.4
7Claude Haiku 4.564.4
8GPT-5.4 Mini62.8

Interactive version: theaggregate.ai/benchmark?slug=can-large-language-models-handle-discourse-par · How the rankings work · Data refreshed daily, snapshot 2026-07-22.