Qwen3 235B A22B Thinking 2507 — benchmark results

Provider: Alibaba. Released 2025-07-25. Access: Open.

Unified ELO 1697 ± 32, rank #335 of 1839 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WritingBench82.34Score (self-reported)98.1
OPT-BENCH62EG (20 steps) (self-reported)88.9
WildAgtEval62.6Complexity-Injected API Call Accuracy (self-reported)87.5
Forge82.3Overall SR (self-reported)80
ActTraitBench1.54G_KD (Global Knowledge-Decision Gap) (self-reported)78.6
Korean Canonical Legal Benchmark70.4Mean with supporting precedents (self-reported)73.3
LiveFMBench37.11Pass@1 Before (Pre2025) (self-reported)70
FINESSE-Bench83.81exam-like (self-reported)63.3
LM Market Cap LMC Score65.5LMC Score (0-100)59.1
PLawBench62.82Overall (self-reported)56.5
Creative Writing v31378.7Elo score (self-reported)52.5
MultiNRC27.11Score (self-reported)42.1

Interactive version: theaggregate.ai/model?slug=qwen3-235b-a22b-thinking-2507 · How It Works · Data refreshed daily, snapshot 2026-08-05.