Qwen 3 4B 2507 Instruct — benchmark results
Alibaba's 2507 refresh of Qwen3-4B that runs in non-thinking mode only, with 256K native context and improved instruction following and multilingual coverage. Provider: Alibaba. Released 2025-07-01. Access: Open.
Unified ELO 1449 ± 7, rank #1004 of 1776 rated models, from 357 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Spanish NLU - Sentiment Headlines ES | 50.33 | Sentiment classification Score (%) | 92 |
| LatamBoard - FaQuAD NLI | 81.19 | Score (%) | 90.9 |
| LatamBoard - Portuguese Score | 88.39 | Score (%) | 90.9 |
| LatamBoard - ASSIN2 RTE | 92.64 | Score (%) | 87.9 |
| LatamBoard - BLUEX | 67.32 | Score (%) | 87.9 |
| LatamBoard - ENEM Challenge | 75.37 | Score (%) | 87.9 |
| EuroEval Lithuanian NLU - MultiWikiQA LT | 65.25 | Reading comprehension Score (%) | 79 |
| EuroEval Icelandic NLU - NQII | 53.03 | Reading comprehension Score (%) | 78.3 |
| EuroEval Spanish Common Sense Reasoning | 63.92 | Common Sense Reasoning Average Score (%) | 77.5 |
| LatamBoard - OAB Exams | 51.39 | Score (%) | 75.8 |
| EuroEval Spanish | 52.92 | Average Score (%) | 75.7 |
| EuroEval Italian Common Sense Reasoning | 58.94 | Common Sense Reasoning Average Score (%) | 75.3 |
Interactive version: theaggregate.ai/model?slug=qwen-3-4b-2507-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.