Qwen 3.5 2B (Thinking): benchmark results

Provider: Alibaba. Released 2026-03-02. Access: Open.

Unified ELO 1414 ± 1, rank #2350 of 3078 rated models, from 45 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MedLayXPlain63.7S (self-reported)77.4
Avalon-ToM-Bench - Perspective-Taking55.88Accuracy (%)28.8
Swallow - Post-trained English - GPQA Diamond49.5Accuracy (%)26.9
FrameBench - Frame Identification - English68Accuracy (%; FrameNet candidate frames)26.3
FrameBench - Frame Identification - Japanese54.3Accuracy (%; Japanese FrameNet candidate frames)24
FrameBench - English80.3Accuracy (%; mean of five prompt templates)21.1
FrameBench - Japanese60.7Accuracy (%; mean of five prompt templates)20
Swallow - English MT-Bench - Math84Judge Score (normalized, %)19.4
Swallow - Post-trained English - MATH-50081.2Accuracy (%)17.9
Swallow - Post-trained English - MMLU-Pro58.9Accuracy (%)17.9
Avalon-ToM-Bench - Tacit Coordination63.5Accuracy (%)15.4
Avalon-ToM-Bench - Intention Attribution65Accuracy (%)13.5

Interactive version: theaggregate.ai/model?slug=qwen-3-5-2b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.