Open Japanese LLM v2 - M-IFEval-Ja: leaderboard

Metric: Prompt-Level Strict Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Llama 3.3 70B Instruct47.09
2llm-jp-4-8B (Thinking)45.35
3GPT-OSS-120B44.77
4llm-jp-4-32B-a3B (Thinking)44.77
5Qwen 3.6 27B (Non-reasoning)44.19
6Qwen 3 8B (Thinking)43.6
7Qwen 3.5 27B (Non-reasoning)41.86
8gemma-4-26B-A4B-it (Thinking)40.12
9Llama-3.3-Swallow-70B-Instruct-v0.437.79
10Qwen 3 32B (Non-reasoning)37.21
11Gemma 3 27B (IT)34.88
12GPT-OSS-20B33.14
13llm-jp-3.1-13B-instruct429.07

Interactive version: theaggregate.ai/benchmark?slug=open-japanese-llm-v2-m-ifeval-ja · How It Works · Data refreshed daily, snapshot 2026-09-19.