Qwen3-4B-Base: benchmark results
Provider: Alibaba. Access: Open.
Unified ELO 1538 ± 23, rank #896 of 2656 rated models, from 161 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Swallow - Pre-trained English - HumanEval | 61.7 | Pass@1 (%) | 89.8 |
| Open Arabic LLM - Arabic MMLU Philosophy (High School) | 69.23 | Accuracy (%) | 88.6 |
| Open Arabic LLM - Aratrust MentalHealth | 94.74 | Accuracy (%) | 87.3 |
| Swallow - Pre-trained English - MATH | 52 | Exact Match (%) | 84.7 |
| Swallow - Pre-trained Japanese - JHumanEval | 53.7 | Pass@1 (%) | 83.7 |
| Open Arabic LLM - Arabic MMLU HT Abstract Algebra | 38 | Accuracy (%) | 81.8 |
| Open Arabic LLM - Aratrust Illegal | 92.45 | Accuracy (%) | 81.7 |
| Open Arabic LLM - Arabic MMLU Geography (Primary School) | 75.44 | Accuracy (%) | 81.5 |
| Open Arabic LLM - Aratrust Offensive | 89.86 | Accuracy (%) | 80.7 |
| Open Arabic LLM - Arabic MMLU Computer Science (Primary School) | 76.32 | Accuracy (%) | 80.6 |
| Open Arabic LLM - Arabic MMLU HT High School Physics | 49.67 | Accuracy (%) | 80.2 |
| Open Arabic LLM - Arabic MMLU HT High School Mathematics | 40.37 | Accuracy (%) | 79.6 |
Interactive version: theaggregate.ai/model?slug=qwen3-4b-base · How It Works · Data refreshed daily, snapshot 2026-09-19.