Qwen 2.5 7B — benchmark results
Alibaba's Apache-2.0 7B base model from the Qwen2.5 series (September 2024), pretrained on 18T tokens with 128K context. Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1448 ± 11, rank #1005 of 1776 rated models, from 255 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Relevance as a Vulnerability | 3.45 | Agent (self-reported) | 100 |
| LA Leaderboard - AQuAS | 70.73 | Accuracy (%) | 95.6 |
| Open Arabic LLM - Arabic MMLU Computer Science (Primary School) | 79.47 | Accuracy (%) | 92 |
| Benchmarking Large Language Models for Graphem | 79.39 | Direct (self-reported) | 91.7 |
| LA Leaderboard - Spanish Law Exams | 39.5 | Accuracy (%) | 88.2 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 54.95 | Accuracy (%) | 87.3 |
| LA Leaderboard - EusExams Basque | 39.81 | Accuracy (%) | 87.2 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 80.74 | Accuracy (%) | 86.4 |
| Open Arabic LLM - Arabic MMLU LAW (Professional) | 74.84 | Accuracy (%) | 85.8 |
| LA Leaderboard | 56.49 | Average Score (%) | 83.8 |
| Open Arabic LLM - Arabic MMLU HT High School Mathematics | 41.48 | Accuracy (%) | 82.1 |
| Open Arabic LLM - Arabic MMLU HT College Mathematics | 46 | Accuracy (%) | 81.8 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.