Qwen 3 4B Instruct — benchmark results
Alibaba's open 4B dense model from the original April 2025 Qwen3 release, used in instruct (non-thinking) mode. Provider: Alibaba. Released 2025-04-28. Access: Open.
Unified ELO 1523 ± 37, rank #709 of 1776 rated models, from 33 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenEval - Omni-MATH | 38.47 | Accuracy (%) | 97.5 |
| OpenEval - IFEval Strict | 87.15 | Strict Accuracy (%) | 95.2 |
| OpenEval - MMLU-Pro CoT | 66 | CoT Correctness (%) | 92.9 |
| Fibble4 Arena | 5.88 | Win Rate (%) | 90.5 |
| OpenEval - BBQ | 91.39 | Exact Match (%) | 90.5 |
| OpenEval - GPQA CoT | 39.69 | CoT Correctness (%) | 90.5 |
| LOM Benchmark - PageRank | 36 | Accuracy (%) | 41.7 |
| Fibble2 Arena | 0 | Win Rate (%) | 41.1 |
| Fibble3 Arena | 0 | Win Rate (%) | 39.3 |
| Fibble5 Arena | 0 | Win Rate (%) | 36.7 |
| LOM Benchmark - Neighbor | 61 | Accuracy (%) | 33.3 |
| SciPaths | 6 | F1 (self-reported) | 33.3 |
Interactive version: theaggregate.ai/model?slug=qwen-3-4b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.