SeaEval - Dialogue - DialogSum (Zero-Shot): leaderboard

Metric: Average ROUGE (0-100). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Gemma 2 2B (IT)25.97
2Llama 3 8B Cpt Sea Lionv2 Instruct25.78
3Gemma 2 9B (IT)25.61
4Llama 3 70B Instruct25.57
5Llama 3 8B Cpt Sea Lionv2.1 Instruct25.38
6Llama 3.1 70B Instruct25.26
7Llama 3.1 8B Instruct25.25
8Qwen 2.5 7B Instruct25.03
9SeaLLMs-v3-7B-Chat24.89
10Llama 3.1 70B Cpt Sea Lionv3 Instruct24.81
11Llama 3 8B Instruct23.98
12Qwen 2.5 32B Instruct23.94
13gemma2-9B-cpt-sea-lionv3-instruct23.79
14Qwen 2.5 72B Instruct23.46
15Qwen 2.5 14B Instruct23.43

Interactive version: theaggregate.ai/benchmark?slug=seaeval-dialogue-dialogsum-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.