llm-jp-4-32B-a3B (Thinking): benchmark results

Provider: Other. Released 2026-03-16. Access: Open.

Unified ELO 1562 ± 1, rank #887 of 3078 rated models, from 139 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Japanese LLM v2 - JCulture-MCQ55.22Set F1 (%)100
Open Japanese LLM v2 - JFinQA67.5Accuracy (%)100
Nejumi 4 - BFCL - Irrelevance Detection93.33Accuracy (%)92.3
Nejumi 4 - MT-Bench (Japanese) - Humanities100Judge rating (1-10, x10)90.4
Nejumi 4 - MT-Bench (Japanese) - Math100Judge rating (1-10, x10)89
Open Japanese LLM v2 - JCoLA Out-of-Domain80.12Accuracy (%)85.7
Open Japanese LLM v2 - M-IFEval-Ja44.77Prompt-Level Strict Accuracy (%)83.3
Nejumi 4 - jaster (0-shot) - JCoLA (out-of-domain)87Exact match (%)81.6
Swallow - Japanese MT-Bench - Extraction75Judge Score (normalized, %)80.6
Swallow - English MT-Bench - Extraction80.5Judge Score (normalized, %)76.1
Nejumi 4 - Toxicity - Violation Categories47.62Criteria met (%)75.7
Swallow - Japanese MT-Bench - Humanities68.6Judge Score (normalized, %)74.6

Interactive version: theaggregate.ai/model?slug=llm-jp-4-32b-a3b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.