Qwen 3 4B Instruct: benchmark results
Alibaba's open 4B dense model from the original April 2025 Qwen3 release, used in instruct (non-thinking) mode. Provider: Alibaba. Released 2025-04-28. Access: Open.
Unified ELO 1543 ± 1, rank #470 of 1392 rated models, from 33 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenEval - Omni-MATH | 38.53 | Accuracy (%) | 100 |
| OpenEval - IFEval Strict | 87.15 | Strict Accuracy (%) | 91.3 |
| Fibble4 Arena | 5.88 | Win Rate (%) | 90.5 |
| OpenEval - MMLU-Pro CoT | 66 | CoT Correctness (%) | 87 |
| OpenEval - GPQA CoT | 39.69 | CoT Correctness (%) | 86.4 |
| OpenEval - BBQ | 91.39 | Exact Match (%) | 79.5 |
| LOM Benchmark - PageRank | 36 | Accuracy (%) | 41.7 |
| Fibble2 Arena | 0 | Win Rate (%) | 41.1 |
| Fibble3 Arena | 0 | Win Rate (%) | 39.3 |
| Fibble5 Arena | 0 | Win Rate (%) | 36.7 |
| LOM Benchmark - Neighbor | 61 | Accuracy (%) | 33.3 |
| SciPaths | 6 | F1 (self-reported) | 33.3 |
Interactive version: theaggregate.ai/model?slug=qwen-3-4b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.