Qwen 3 4B Instruct: benchmark results

Alibaba's open 4B dense model from the original April 2025 Qwen3 release, used in instruct (non-thinking) mode. Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1543 ± 1, rank #470 of 1392 rated models, from 33 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenEval - Omni-MATH38.53Accuracy (%)100
OpenEval - IFEval Strict87.15Strict Accuracy (%)91.3
Fibble4 Arena5.88Win Rate (%)90.5
OpenEval - MMLU-Pro CoT66CoT Correctness (%)87
OpenEval - GPQA CoT39.69CoT Correctness (%)86.4
OpenEval - BBQ91.39Exact Match (%)79.5
LOM Benchmark - PageRank36Accuracy (%)41.7
Fibble2 Arena0Win Rate (%)41.1
Fibble3 Arena0Win Rate (%)39.3
Fibble5 Arena0Win Rate (%)36.7
LOM Benchmark - Neighbor61Accuracy (%)33.3
SciPaths6F1 (self-reported)33.3

Interactive version: theaggregate.ai/model?slug=qwen-3-4b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.