Nejumi 4 - M-IFEval (Japanese): leaderboard

Metric: Score (%). Source: nejumi.ai. 137 models tracked.

Top models

#ModelScore
1Grok 4.5 (High)94.25
2GPT-5.6 Sol (Max)92.48
3GPT-5.6 Terra (Max)91.59
4Qwen 3.6 Max (Preview) (Thinking)91.59
5GPT-5.5 (xHigh)91.15
6DeepSeek V4.1 Flash91.15
7GPT-5.4 (xHigh)90.71
8GPT-5.4 (High)90.71
9Muse Glimmer 30B (xHigh)90.71
10Gemini 3.1 Pro (Preview)90.27
11Gemini 3 Flash (Preview)90.27
12DeepSeek V4 Pro (Max)90.27
13Gemini 3.6 Flash89.38
14GPT-5.1 (High)89.38
15GPT-5.2 (xHigh)89.38

Interactive version: theaggregate.ai/benchmark?slug=nejumi-4-m-ifeval-japanese · How It Works · Data refreshed daily, snapshot 2026-09-19.