qwq-bakeneko-32B: benchmark results
Provider: Alibaba. Released 2025-03-12. Access: Open.
Unified ELO 1630 ± 25, rank #521 of 2656 rated models, from 131 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Swallow - English MT-Bench - Math | 99.3 | Judge Score (normalized, %) | 92.5 |
| Nejumi 4 - BFCL - Live AST | 74.07 | Accuracy (%) | 89.3 |
| Nejumi 4 - BFCL - Non-Live AST | 80.74 | Accuracy (%) | 87.1 |
| Nejumi 4 - BFCL - Irrelevance Detection | 91.67 | Accuracy (%) | 86.4 |
| Nejumi 4 - JHumanEval | 42.97 | Sandbox pass rate (%) | 86 |
| Nejumi 4 - jaster (0-shot) - JSICK | 83 | Exact match (%) | 84.6 |
| Swallow - English MT-Bench - Reasoning | 86.5 | Judge Score (normalized, %) | 78.4 |
| Swallow - Post-trained English - HellaSwag | 90.2 | Accuracy (%) | 73.1 |
| Nejumi 4 - jaster (2-shot) - JSICK | 82 | Exact match (%) | 72.1 |
| Nejumi 4 - Toxicity - Social Norms | 96.83 | Criteria met (%) | 64.3 |
| Swallow - Post-trained English - MMLU-Pro | 77.2 | Accuracy (%) | 61.2 |
| Nejumi 4 - MT-Bench (Japanese) - Roleplay | 97.5 | Judge rating (1-10, x10) | 61 |
Interactive version: theaggregate.ai/model?slug=qwq-bakeneko-32b · How It Works · Data refreshed daily, snapshot 2026-09-19.