Ebisu - Overall: leaderboard

Metric: Mean Task Score (%). Source: arxiv.org. 22 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct40.11
2Llama-3.3-Swallow-70B-Instruct-v0.438.51
3Llama 4 Scout37.78
4Claude Sonnet 4.536.18
5Kimi K235.9
6Qwen 3 235B A22B 2507 Instruct34.51
7Qwen 2.5 32B Instruct34.39
8DeepSeek V3.132.67
9Ministral-3-14B-Instruct-251228.87
10GPT-4o24.61
11Qwen 3 32B15.75
12Qwen 3 14B11.79
13GPT-511.06
14TinySwallow-1.5B-Instruct9.13
15Qwen-14B8.57

Interactive version: theaggregate.ai/benchmark?slug=ebisu-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.