Swallow - Pre-trained English - HumanEval: leaderboard

Metric: Pass@1 (%). Source: swallow-llm.github.io. 50 models tracked.

Top models

#ModelScore
1Qwen3-14B-Base70.9
2Qwen3-30B-A3B-Base69.4
3Qwen3-8B-Base66.9
4Qwen3-4B-Base61.7
5Qwen 2.5 7B55.4
6Qwen 2.5 72B55.4
7Llama 3.1 70B54.6
8Qwen 2.5 14B54.4
9Falcon3-10B-Base54.3
10sarashina2.2-3B53
11Qwen 2.5 32B52.3
12Gemma 2 27B50.8
13gemma-3-27B-pt50.7
14Falcon3-7B-Base47.6
15Qwen3-1.7B-Base46.2

Interactive version: theaggregate.ai/benchmark?slug=swallow-pre-trained-english-humaneval · How It Works · Data refreshed daily, snapshot 2026-09-19.