Qwen3-VL-235B-A22B-Thinking-FP8 — benchmark results
Qwen3-VL-235B-A22B-Thinking evaluated in FP8 quantization. Provider: Alibaba. Released 2025-09-22. Access: Open.
Unified ELO 1760 ± 32, rank #181 of 1776 rated models, from 11 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| RewardBench 2 Safety | 96.44 | Accuracy (%) | 100 |
| MATH-MC Level 4 | 99.58 | Accuracy (%) | 95.6 |
| MATH-MC Level 5 | 99.77 | Accuracy (%) | 94.9 |
| GSM-MC | 99.32 | Accuracy (%) | 87.3 |
| RewardBench 2 Focus | 90.91 | Accuracy (%) | 81.4 |
| MATH-MC Level 3 | 99.1 | Accuracy (%) | 79.4 |
| RewardBench 2 Factuality | 78.11 | Accuracy (%) | 69.6 |
| MATH-MC Level 1 | 98.37 | Accuracy (%) | 64.7 |
| RewardBench 2 Math | 86.89 | Accuracy (%) | 56.9 |
| RewardBench 2 Precise IF | 63.12 | Accuracy (%) | 54.9 |
| MATH-MC Level 2 | 98.07 | Accuracy (%) | 45.6 |
Interactive version: theaggregate.ai/model?slug=qwen3-vl-235b-a22b-thinking-fp8 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.