ELYZA-Shortcut-1.0-Qwen-32B: benchmark results

Provider: Other. Released 2025-04-30. Access: Open.

Unified ELO 1614 ± 26, rank #572 of 2656 rated models, from 131 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - BFCL - Relevance Detection100Accuracy (%)98.5
Nejumi 4 - jaster (0-shot) - JSQuAD82.25Character F1 (x100)96.3
Nejumi 4 - JHumanEval52.64Sandbox pass rate (%)94.1
Nejumi 4 - GLP - Information Retrieval81.61Score (%)93
Nejumi 4 - Toxicity - Social Norms98.81Criteria met (%)90.8
Swallow - English MT-Bench - Extraction82.7Judge Score (normalized, %)87.3
Nejumi 4 - jaster (2-shot) - JSQuAD80.97Character F1 (x100)86.4
Nejumi 4 - BFCL - Non-Live AST78.89Accuracy (%)75
Nejumi 4 - JBBQ (2-shot) - Accuracy92Accuracy (%)72.8
Swallow - Post-trained Japanese - WMT20 Ja-En22.8BLEU72.4
Nejumi 4 - Toxicity - Violation Categories46.83Criteria met (%)71
Swallow - Post-trained English - HellaSwag89.7Accuracy (%)70.1

Interactive version: theaggregate.ai/model?slug=elyza-shortcut-1-0-qwen-32b · How It Works · Data refreshed daily, snapshot 2026-09-19.