Qwen3 235B A22B Thinking 2507 — benchmark results
Provider: Alibaba. Released 2025-07-25. Access: Open.
Unified ELO 1697 ± 32, rank #335 of 1839 rated models, from 16 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| WritingBench | 82.34 | Score (self-reported) | 98.1 |
| OPT-BENCH | 62 | EG (20 steps) (self-reported) | 88.9 |
| WildAgtEval | 62.6 | Complexity-Injected API Call Accuracy (self-reported) | 87.5 |
| Forge | 82.3 | Overall SR (self-reported) | 80 |
| ActTraitBench | 1.54 | G_KD (Global Knowledge-Decision Gap) (self-reported) | 78.6 |
| Korean Canonical Legal Benchmark | 70.4 | Mean with supporting precedents (self-reported) | 73.3 |
| LiveFMBench | 37.11 | Pass@1 Before (Pre2025) (self-reported) | 70 |
| FINESSE-Bench | 83.81 | exam-like (self-reported) | 63.3 |
| LM Market Cap LMC Score | 65.5 | LMC Score (0-100) | 59.1 |
| PLawBench | 62.82 | Overall (self-reported) | 56.5 |
| Creative Writing v3 | 1378.7 | Elo score (self-reported) | 52.5 |
| MultiNRC | 27.11 | Score (self-reported) | 42.1 |
Interactive version: theaggregate.ai/model?slug=qwen3-235b-a22b-thinking-2507 · How It Works · Data refreshed daily, snapshot 2026-08-05.