Qwen3 235B A22B Thinking (2507): benchmark results
Provider: Alibaba. Released 2025-07-25. Access: Open.
Unified ELO 1823 ± 51, rank #124 of 2656 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| RAI-Bench - Refusal Rate (General) | 86 | Rate (%) | 100 |
| RAI-Bench - RAG Robustness (HY Factuality) | 44 | Rate (%) | 87.7 |
| RAI-Bench - Refusal Rate (JD) | 96 | Rate (%) | 85.9 |
| RAI-Bench - Refusal Rate (Career) | 98 | Rate (%) | 82.5 |
| RAI-Bench - RAG Robustness (LC Factuality) | 44 | Rate (%) | 73.9 |
| RAI-Bench - Refusal Rate (Physics) | 100 | Rate (%) | 63 |
| ObviousBench | 94.44 | Answer pass³ (%) | 60.3 |
| RAI-Bench - RAG Robustness (HY Abstention) | 84 | Rate (%) | 59.4 |
| LM Market Cap LMC Score | 65.3 | LMC Score (0-100) | 57.1 |
| PLawBench | 62.82 | Overall (self-reported) | 50 |
| OpenRouter GPQA Diamond | 80 | Accuracy (%) | 45.9 |
| RAI-Bench - RAG Robustness (LC Abstention) | 76 | Rate (%) | 34.8 |
Interactive version: theaggregate.ai/model?slug=qwen3-235b-a22b-thinking-2507 · How It Works · Data refreshed daily, snapshot 2026-09-19.