FrameBench - Japanese: leaderboard

Metric: Accuracy (%; mean of five prompt templates). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT) (Thinking)99.1
2Gemma 4 31B (IT) (Non-reasoning)97.6
3Gemini 3.1 Pro (Preview)97.5
4Qwen 3.5 27B (Thinking)97.3
5GPT-596.3
6Qwen 3 32B (Thinking)93.9
7Gemma 4 E4B (IT) (Thinking)92.2
8Qwen 3.5 9B (Thinking)91.8
9Qwen 3.5 4B (Thinking)89.9
10Qwen 3 8B (Thinking)85
11Gemma 4 E4B (IT) (Non-reasoning)84.6
12llm-jp-4-8B (Thinking)84.5
13GPT-5 Nano83.9
14Qwen 3.5 27B (Non-reasoning)83.7
15Gemma 4 E2B (IT) (Thinking)82.3

Interactive version: theaggregate.ai/benchmark?slug=framebench-japanese · How It Works · Data refreshed daily, snapshot 2026-09-19.