SeaEval - Dialogue - DREAM (Zero-Shot): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 24 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct96.28
2Qwen 2 72B Instruct96.13
3Llama 3.1 70B Cpt Sea Lionv3 Instruct95.64
4Llama 3.1 70B Instruct95.59
5Qwen 2.5 32B Instruct95.59
6Llama 3 70B Instruct94.81
7Qwen 2.5 14B Instruct94.61
8Gemma 2 9B (IT)94.17
9gemma2-9B-cpt-sea-lionv3-instruct94.07
10Qwen 2 7B Instruct93.53
11Qwen 2.5 7B Instruct93.48
12SeaLLMs-v3-7B-Chat92.65
13Llama 3.1 8B Instruct90.54
14Sailor2-8B-Chat90.54
15Qwen 2.5 3B Instruct90.3

Interactive version: theaggregate.ai/benchmark?slug=seaeval-dialogue-dream-zero-shot · How It Works · Data refreshed daily, snapshot 2026-09-05.