Qwen 3.6 Plus — benchmark results

Alibaba Qwen 3.6 Plus model for high-end chat, coding, and reasoning workloads. Provider: Alibaba. Released 2026-04-02. Access: API.

Unified ELO 1752 ± 8, rank #193 of 1776 rated models, from 548 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CC-OCR V275.77Average (self-reported)100
From Knowing to Doing85.29Total ret. (self-reported)100
JudgeBench Math96.43Accuracy (%)100
LLM Stats (C-Eval)93.3Score (%)100
LLM Stats (CC-OCR)83.4Score (%)100
LLM Stats (DynaMath)88Score (%)100
LLM Stats (MMLongBench-Doc)62Score (%)100
LLM Stats (MMStar)83.3Score (%)100
LLM Stats (ODinW)51.8Score (%)100
LLM Stats (RefCOCO-avg)93.5Score (%)100
RewardBench 2 Math91.8Accuracy (%)99
Evals for Every Language - Language new93.33Average Score (%)98.5

Interactive version: theaggregate.ai/model?slug=qwen-3-6-plus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.