Qwen 3 235B A22B (Thinking): benchmark results

Alibaba Qwen 3 235B A22B evaluated with thinking enabled. Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1592 ± 1, rank #469 of 1761 rated models, from 96 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - Med-HALT Reasoning FCT90.07Score (%)95.7
Medmarks - LongHealth Task 190.67Score (%)94.3
Medmarks - LongHealth Task 290.25Score (%)94.3
Medmarks - MedQA92.96Score (%)94.3
Medmarks - SuperGPQA Medicine Easy66.7Score (%)94.3
Medmarks - M-ARC66Score (%)92.9
Medmarks - Medbullets OP485.71Score (%)92.9
Medmarks - CareQA EN93.13Score (%)91.4
Medmarks - HEAD-QA v290.05Score (%)91.4
Medmarks - MedConceptsQA Easy99.47Score (%)91.4
Medmarks - MedConceptsQA Hard79.27Score (%)91.4
Medmarks - MedConceptsQA Medium85.95Score (%)91.4

Interactive version: theaggregate.ai/model?slug=qwen-3-235b-a22b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.