Qwen3-VL-235B-A22B-Thinking-FP8 — benchmark results

Qwen3-VL-235B-A22B-Thinking evaluated in FP8 quantization. Provider: Alibaba. Released 2025-09-22. Access: Open.

Unified ELO 1760 ± 32, rank #181 of 1776 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench 2 Safety96.44Accuracy (%)100
MATH-MC Level 499.58Accuracy (%)95.6
MATH-MC Level 599.77Accuracy (%)94.9
GSM-MC99.32Accuracy (%)87.3
RewardBench 2 Focus90.91Accuracy (%)81.4
MATH-MC Level 399.1Accuracy (%)79.4
RewardBench 2 Factuality78.11Accuracy (%)69.6
MATH-MC Level 198.37Accuracy (%)64.7
RewardBench 2 Math86.89Accuracy (%)56.9
RewardBench 2 Precise IF63.12Accuracy (%)54.9
MATH-MC Level 298.07Accuracy (%)45.6

Interactive version: theaggregate.ai/model?slug=qwen3-vl-235b-a22b-thinking-fp8 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.