Qwen 3 4B: benchmark results
Alibaba's 4B dense Qwen3 model with switchable thinking/non-thinking modes, matching prior 7B-class Qwen2.5 quality (April 2025). Provider: Alibaba. Released 2025-04-28. Access: Open.
Unified ELO 1467 ± 1, rank #857 of 1392 rated models, from 375 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ProtStructQA | 70.33 | Standard (self-reported) | 100 |
| MERA - ruHumanEval | 76.16 | pass@1 (%) | 95.7 |
| MERA - MathLogicQA | 99.39 | Accuracy (%) | 95 |
| MERA Code - stRuCom | 33.34 | chrF (%) | 93.8 |
| ChineseSafe Benchmark | 74.95 | Accuracy (%) | 92.6 |
| MERA - ruModAr | 99.57 | EM (%) | 91.9 |
| MERA - ruCodeEval | 64.76 | pass@1 (%) | 91.4 |
| BTZSC | 64.86 | Macro-F1 (%) | 91.2 |
| BTZSC - Topic | 63.83 | Macro-F1 (%) | 91.2 |
| FACTS Leaderboard | 42.55 | Combined Score (%) | 90.9 |
| MERA - ruMultiAr | 98.54 | EM (%) | 89.7 |
| Benchmarking Large Language Models for Graphem | 57.72 | Direct (self-reported) | 88.9 |
Interactive version: theaggregate.ai/model?slug=qwen-3-4b · How It Works · Data refreshed daily, snapshot 2026-09-05.