Qwen 3 4B Instruct — benchmark results

Alibaba's open 4B dense model from the original April 2025 Qwen3 release, used in instruct (non-thinking) mode. Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1523 ± 37, rank #709 of 1776 rated models, from 33 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenEval - Omni-MATH38.47Accuracy (%)97.5
OpenEval - IFEval Strict87.15Strict Accuracy (%)95.2
OpenEval - MMLU-Pro CoT66CoT Correctness (%)92.9
Fibble4 Arena5.88Win Rate (%)90.5
OpenEval - BBQ91.39Exact Match (%)90.5
OpenEval - GPQA CoT39.69CoT Correctness (%)90.5
LOM Benchmark - PageRank36Accuracy (%)41.7
Fibble2 Arena0Win Rate (%)41.1
Fibble3 Arena0Win Rate (%)39.3
Fibble5 Arena0Win Rate (%)36.7
LOM Benchmark - Neighbor61Accuracy (%)33.3
SciPaths6F1 (self-reported)33.3

Interactive version: theaggregate.ai/model?slug=qwen-3-4b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.