Open Japanese LLM v2 - StructEval: leaderboard
Metric: StructEval Score (%). Source: huggingface.co. 8 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-OSS-120B | 85.74 |
| 2 | GPT-OSS-20B | 85.66 |
| 3 | Qwen 3 8B (Thinking) | 80.78 |
| 4 | llm-jp-4-32B-a3B (Thinking) | 78.63 |
| 5 | llm-jp-4-8B (Thinking) | 77.91 |
| 6 | gemma-4-26B-A4B-it (Thinking) | 73.26 |
Interactive version: theaggregate.ai/benchmark?slug=open-japanese-llm-v2-structeval · How It Works · Data refreshed daily, snapshot 2026-09-19.