ELYZA-Shortcut-1.0-Qwen-32B: benchmark results
Provider: Other. Released 2025-04-30. Access: Open.
Unified ELO 1614 ± 26, rank #572 of 2656 rated models, from 131 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - BFCL - Relevance Detection | 100 | Accuracy (%) | 98.5 |
| Nejumi 4 - jaster (0-shot) - JSQuAD | 82.25 | Character F1 (x100) | 96.3 |
| Nejumi 4 - JHumanEval | 52.64 | Sandbox pass rate (%) | 94.1 |
| Nejumi 4 - GLP - Information Retrieval | 81.61 | Score (%) | 93 |
| Nejumi 4 - Toxicity - Social Norms | 98.81 | Criteria met (%) | 90.8 |
| Swallow - English MT-Bench - Extraction | 82.7 | Judge Score (normalized, %) | 87.3 |
| Nejumi 4 - jaster (2-shot) - JSQuAD | 80.97 | Character F1 (x100) | 86.4 |
| Nejumi 4 - BFCL - Non-Live AST | 78.89 | Accuracy (%) | 75 |
| Nejumi 4 - JBBQ (2-shot) - Accuracy | 92 | Accuracy (%) | 72.8 |
| Swallow - Post-trained Japanese - WMT20 Ja-En | 22.8 | BLEU | 72.4 |
| Nejumi 4 - Toxicity - Violation Categories | 46.83 | Criteria met (%) | 71 |
| Swallow - Post-trained English - HellaSwag | 89.7 | Accuracy (%) | 70.1 |
Interactive version: theaggregate.ai/model?slug=elyza-shortcut-1-0-qwen-32b · How It Works · Data refreshed daily, snapshot 2026-09-19.