Qwen 2.5 3B Instruct: benchmark results
Alibaba Qwen 2.5 3B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1429 ± 1, rank #1032 of 1392 rated models, from 327 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open CoT - LogiQA | 9.42 | CoT Gain (%) | 93.5 |
| LA Leaderboard - GalCoLA | 57.93 | Accuracy (%) | 92.6 |
| Open LLM Leaderboard - MATH Level 5 | 36.78 | Score | 87.2 |
| ChineseSafe Benchmark | 71.81 | Accuracy (%) | 85.2 |
| Mobile-MMLU | 68.1 | Overall Accuracy (%) | 81 |
| Open CoT - LogiQA 2 | 12.47 | CoT Gain (%) | 77.5 |
| Open LLM Leaderboard - IFEval | 64.75 | Score | 76.9 |
| LA Leaderboard | 55.93 | Average Score (%) | 76.5 |
| LA Leaderboard - AQuAS | 67.69 | Accuracy (%) | 75 |
| SeaEval - Fundamental NLP Tasks - MNLI (Zero-Shot) | 74.65 | Accuracy (%) | 73.9 |
| Open CoT - LSAT Reading Comprehension | 16.73 | CoT Gain (%) | 72.5 |
| Open Arabic LLM - Alghafa Multiple Choice Sentiment Task | 40.52 | Accuracy (%) | 71.9 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-3b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.