Qwen 3 235B A22B 2507 (Thinking) — benchmark results

Qwen 3 235B A22B 2507 evaluated with thinking enabled. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1723 ± 25, rank #232 of 1776 rated models, from 64 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA MATH-50098.4Accuracy (%)94.6
AA AIME 202591Accuracy (%)92
AA LiveCodeBench78.84Pass@1 (%)90.6
LLM2014 Logic 2025-1054.18Median Score89.8
AA MMLU-Pro84.26Accuracy (%)89
AA Long Context Reasoning67Accuracy (%)86.8
LLM2014 Logic 2025-0953.11Median Score86.7
LLM2014 Logic 2025-0856.93Median Score86.4
AA Omniscience - Software Engineering (SWE) - Julia36Accuracy (%)84.6
AA Global-MMLU-Lite - Indonesian90Accuracy (%)80.8
LLM2014 Logic 2025-1151.81Median Score80.8
AA Omniscience - Software Engineering (SWE) - Rust66Accuracy (%)80.6

Interactive version: theaggregate.ai/model?slug=qwen-3-235b-a22b-2507-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.