Qwen3 235B A22B Thinking (2507): benchmark results

Provider: Alibaba. Released 2025-07-25. Access: Open.

Unified ELO 1823 ± 51, rank #124 of 2656 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RAI-Bench - Refusal Rate (General)86Rate (%)100
RAI-Bench - RAG Robustness (HY Factuality)44Rate (%)87.7
RAI-Bench - Refusal Rate (JD)96Rate (%)85.9
RAI-Bench - Refusal Rate (Career)98Rate (%)82.5
RAI-Bench - RAG Robustness (LC Factuality)44Rate (%)73.9
RAI-Bench - Refusal Rate (Physics)100Rate (%)63
ObviousBench94.44Answer pass³ (%)60.3
RAI-Bench - RAG Robustness (HY Abstention)84Rate (%)59.4
LM Market Cap LMC Score65.3LMC Score (0-100)57.1
PLawBench62.82Overall (self-reported)50
OpenRouter GPQA Diamond80Accuracy (%)45.9
RAI-Bench - RAG Robustness (LC Abstention)76Rate (%)34.8

Interactive version: theaggregate.ai/model?slug=qwen3-235b-a22b-thinking-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.