Qwen 2.5 3B Instruct: benchmark results

Alibaba Qwen 2.5 3B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1429 ± 1, rank #1032 of 1392 rated models, from 327 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open CoT - LogiQA9.42CoT Gain (%)93.5
LA Leaderboard - GalCoLA57.93Accuracy (%)92.6
Open LLM Leaderboard - MATH Level 536.78Score87.2
ChineseSafe Benchmark71.81Accuracy (%)85.2
Mobile-MMLU68.1Overall Accuracy (%)81
Open CoT - LogiQA 212.47CoT Gain (%)77.5
Open LLM Leaderboard - IFEval64.75Score76.9
LA Leaderboard55.93Average Score (%)76.5
LA Leaderboard - AQuAS67.69Accuracy (%)75
SeaEval - Fundamental NLP Tasks - MNLI (Zero-Shot)74.65Accuracy (%)73.9
Open CoT - LSAT Reading Comprehension16.73CoT Gain (%)72.5
Open Arabic LLM - Alghafa Multiple Choice Sentiment Task40.52Accuracy (%)71.9

Interactive version: theaggregate.ai/model?slug=qwen-2-5-3b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.