qwq-bakeneko-32B: benchmark results

Provider: Alibaba. Released 2025-03-12. Access: Open.

Unified ELO 1630 ± 25, rank #521 of 2656 rated models, from 131 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Swallow - English MT-Bench - Math99.3Judge Score (normalized, %)92.5
Nejumi 4 - BFCL - Live AST74.07Accuracy (%)89.3
Nejumi 4 - BFCL - Non-Live AST80.74Accuracy (%)87.1
Nejumi 4 - BFCL - Irrelevance Detection91.67Accuracy (%)86.4
Nejumi 4 - JHumanEval42.97Sandbox pass rate (%)86
Nejumi 4 - jaster (0-shot) - JSICK83Exact match (%)84.6
Swallow - English MT-Bench - Reasoning86.5Judge Score (normalized, %)78.4
Swallow - Post-trained English - HellaSwag90.2Accuracy (%)73.1
Nejumi 4 - jaster (2-shot) - JSICK82Exact match (%)72.1
Nejumi 4 - Toxicity - Social Norms96.83Criteria met (%)64.3
Swallow - Post-trained English - MMLU-Pro77.2Accuracy (%)61.2
Nejumi 4 - MT-Bench (Japanese) - Roleplay97.5Judge rating (1-10, x10)61

Interactive version: theaggregate.ai/model?slug=qwq-bakeneko-32b · How It Works · Data refreshed daily, snapshot 2026-09-19.