Qwen 2.5 3B — benchmark results

Alibaba's 3B model from the Qwen2.5 series (September 2024), pretrained on up to 18T tokens and released under the non-commercial Qwen Research License. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1408 ± 14, rank #1183 of 1776 rated models, from 211 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Relevance as a Vulnerability3.22Agent (self-reported)85.7
Open Arabic LLM - Arabic MMLU Civics (High School)50.57Accuracy (%)80.6
Open Japanese LLM - Mbpp Pylint Check90.76Score (%)77.9
LA Leaderboard - AQuAS67.79Accuracy (%)76.5
LA Leaderboard - GalCoLA53.42Accuracy (%)73.5
LA Leaderboard - XNLI Galician46.8Accuracy (%)73.5
LA Leaderboard55.69Average Score (%)72.1
LA Leaderboard - Spanish Law Exams34.45Accuracy (%)70.6
Open Japanese LLM - CG45.78Score (%)68.1
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task52.64Accuracy (%)65.4
Open Arabic LLM - Alghafa Multiple Choice Sentiment Task39.65Accuracy (%)63.9
Open Japanese LLM - Xlsum JA Rouge127.34Score (%)63.2

Interactive version: theaggregate.ai/model?slug=qwen-2-5-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.