Open Japanese LLM v2 - JamC-QA: leaderboard

Metric: Exact Match (%). Source: huggingface.co. 20 models tracked.

Top models

#ModelScore
1Llama-3.3-Swallow-70B-Instruct-v0.458.77
2Qwen 3.5 27B (Non-reasoning)54.83
3Qwen 3.6 27B (Non-reasoning)54.66
4llm-jp-4-32B-a3B (Thinking)53.66
5llm-jp-3.1-13B-instruct449.76
6GPT-OSS-120B49.37
7llm-jp-4-8B (Thinking)49.33
8gemma-4-26B-A4B-it (Thinking)48.03
9Gemma 3 27B (IT)47.94
10Qwen 3 32B (Non-reasoning)45.3
11Llama 3.3 70B Instruct44.87
12Qwen 3 8B (Thinking)32.01
13GPT-OSS-20B29.88

Interactive version: theaggregate.ai/benchmark?slug=open-japanese-llm-v2-jamc-qa · How It Works · Data refreshed daily, snapshot 2026-09-19.