Qwen 3 4B 2507 Instruct — benchmark results

Alibaba's 2507 refresh of Qwen3-4B that runs in non-thinking mode only, with 256K native context and improved instruction following and multilingual coverage. Provider: Alibaba. Released 2025-07-01. Access: Open.

Unified ELO 1449 ± 7, rank #1004 of 1776 rated models, from 357 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Spanish NLU - Sentiment Headlines ES50.33Sentiment classification Score (%)92
LatamBoard - FaQuAD NLI81.19Score (%)90.9
LatamBoard - Portuguese Score88.39Score (%)90.9
LatamBoard - ASSIN2 RTE92.64Score (%)87.9
LatamBoard - BLUEX67.32Score (%)87.9
LatamBoard - ENEM Challenge75.37Score (%)87.9
EuroEval Lithuanian NLU - MultiWikiQA LT65.25Reading comprehension Score (%)79
EuroEval Icelandic NLU - NQII53.03Reading comprehension Score (%)78.3
EuroEval Spanish Common Sense Reasoning63.92Common Sense Reasoning Average Score (%)77.5
LatamBoard - OAB Exams51.39Score (%)75.8
EuroEval Spanish52.92Average Score (%)75.7
EuroEval Italian Common Sense Reasoning58.94Common Sense Reasoning Average Score (%)75.3

Interactive version: theaggregate.ai/model?slug=qwen-3-4b-2507-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.