LiveBench Summarize — leaderboard

Metric: Score. Source: livebench.ai. 73 models tracked.

Top models

#ModelScore
1Llama 3.1 70B Instruct83.85
2Gemini 1.5 Pro (Preview 0801)83.13
3Llama 3.1 405B Instruct78.93
4GPT-4o (2024-08-06)75.78
5GPT-4o (2024-05-13)74.62
6Gemini 1.5 Pro (Preview 0827)73.4
7GPT-4 (0613)73.33
8Gemini 1.5 Flash (Preview 0827)72.77
9GPT-4o ChatGPT71.42
10Claude 3 Opus (20240229)70.48
11Claude 3 Haiku (20240307)69.58
12Mistral Large69.23
13Claude 3.5 Sonnet (20240620)68.88
14Mistral Large 2 (Jul)68.15
15GPT-4 Turbo67.6

Interactive version: theaggregate.ai/benchmark?slug=livebench-summarize · How the rankings work · Data refreshed daily, snapshot 2026-07-22.