Qwen 2.5 7B Instruct: benchmark results
Alibaba Qwen 2.5 7B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1452 ± 1, rank #933 of 1392 rated models, from 470 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 50 | Score | 97 |
| LA Leaderboard - GalCoLA | 61.21 | Accuracy (%) | 95.6 |
| Mobile-MMLU | 74.9 | Overall Accuracy (%) | 95.2 |
| Open CoT - LSAT Analytical Reasoning | 9.13 | CoT Gain (%) | 94.3 |
| Thai LLM NLU - wisesight_thai_sentiment_seacrowd_text | 52.86 | Accuracy (%) | 92.8 |
| EVALITA - text-entailment | 83.65 | CPS | 91.5 |
| Open LLM Leaderboard - IFEval | 75.85 | Score | 91.3 |
| LA Leaderboard - AQuAS | 69.85 | Accuracy (%) | 89.7 |
| Open CoT - LSAT Logical Reasoning | 19.22 | CoT Gain (%) | 89.7 |
| Open Korean LLM Leaderboard | 44.66 | Average Score (%) | 89.7 |
| EVALITA - summarization-fanpage | 30.79 | CPS | 89.4 |
| Sahabat-AI - Indonesian (ID) | 59.2 | Score (%) | 87.5 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-7b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.