Swallow - Pre-trained Japanese - JHumanEval: leaderboard

Metric: Pass@1 (%). Source: swallow-llm.github.io. 50 models tracked.

Top models

#ModelScore
1Qwen3-14B-Base70.9
2Qwen 2.5 72B64.8
3Qwen3-30B-A3B-Base64.1
4Qwen 2.5 32B63.7
5Qwen3-8B-Base59.5
6Qwen 2.5 14B55
7Qwen3-4B-Base53.7
8Qwen 2.5 7B50.7
9Gemma 2 27B49
10gemma-3-27B-pt47.3
11Llama 3.1 70B46.2
12Falcon3-10B-Base42.6
13Qwen 2.5 3B40.4
14gemma-3-12B-pt38.5
15Falcon3-7B-Base36.1

Interactive version: theaggregate.ai/benchmark?slug=swallow-pre-trained-japanese-jhumaneval · How It Works · Data refreshed daily, snapshot 2026-09-19.