SEA LLM Leaderboard - SeaBench — leaderboard

Metric: Private Average Score (0-10). Source: huggingface.co. 41 models tracked.

Top models

#ModelScore
1GPT-4.18.9
2Claude 3.5 Sonnet (20241022)8.78
3DeepSeek V3 (0324)8.78
4Claude 3.7 Sonnet (20250219)8.77
5GPT-4o (2024-08-06)8.64
6Gemini 1.5 Pro8.62
7GPT-4.1 Mini8.6
8Gemini 2.0 Flash8.6
9Gemma 3 27B (IT)8.43
10Gemini 2.0 Flash Lite8.26
11GPT-4o Mini (2024-07-18)8.25
12Gemini 1.5 Flash8.18
13Gemma 3 12B (IT)8.1
14Qwen 2.5 72B Instruct7.96
15Claude 3.5 Haiku (20241022)7.87

Interactive version: theaggregate.ai/benchmark?slug=sea-llm-leaderboard-seabench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.