Qwentile2.5-32B-Instruct — benchmark results

maldv's community merge of eight Qwen2.5/QwQ 32B models, aiming to fold QwQ-style reasoning into a steerable instruct model. Provider: Alibaba. Released 2024-12-19. Access: Open.

Unified ELO 1584 ± 11, rank #517 of 1776 rated models, from 179 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro54.21Score99.6
Open LLM Leaderboard - BBH57.21Score98.8
Open Japanese LLM - MR94.6Score (%)98.4
Open LLM Leaderboard - MATH Level 552.19Score97.9
Open Japanese LLM - HE78.64Score (%)97.4
Open Japanese LLM - Jmmlu Exact Match76.39Score (%)97.4
Open Arabic LLM - Aratrust MentalHealth96.05Accuracy (%)97.2
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94.67Accuracy (%)96.9
Open Japanese LLM - Jsem Exact Match80.93Score (%)96.9
Open LLM Leaderboard - GPQA17.9Score96
Open Japanese LLM - MMLU EN Exact Match80.89Score (%)95.7
Open LLM Leaderboard - MuSR19.96Score94.8

Interactive version: theaggregate.ai/model?slug=qwentile2-5-32b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.