Qwen 3 4B: benchmark results

Alibaba's 4B dense Qwen3 model with switchable thinking/non-thinking modes, matching prior 7B-class Qwen2.5 quality (April 2025). Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1467 ± 1, rank #857 of 1392 rated models, from 375 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ProtStructQA70.33Standard (self-reported)100
MERA - ruHumanEval76.16pass@1 (%)95.7
MERA - MathLogicQA99.39Accuracy (%)95
MERA Code - stRuCom33.34chrF (%)93.8
ChineseSafe Benchmark74.95Accuracy (%)92.6
MERA - ruModAr99.57EM (%)91.9
MERA - ruCodeEval64.76pass@1 (%)91.4
BTZSC64.86Macro-F1 (%)91.2
BTZSC - Topic63.83Macro-F1 (%)91.2
FACTS Leaderboard42.55Combined Score (%)90.9
MERA - ruMultiAr98.54EM (%)89.7
Benchmarking Large Language Models for Graphem57.72Direct (self-reported)88.9

Interactive version: theaggregate.ai/model?slug=qwen-3-4b · How It Works · Data refreshed daily, snapshot 2026-09-05.