Qwen 2.5 7B — benchmark results

Alibaba's Apache-2.0 7B base model from the Qwen2.5 series (September 2024), pretrained on 18T tokens with 128K context. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1448 ± 11, rank #1005 of 1776 rated models, from 255 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Relevance as a Vulnerability3.45Agent (self-reported)100
LA Leaderboard - AQuAS70.73Accuracy (%)95.6
Open Arabic LLM - Arabic MMLU Computer Science (Primary School)79.47Accuracy (%)92
Benchmarking Large Language Models for Graphem79.39Direct (self-reported)91.7
LA Leaderboard - Spanish Law Exams39.5Accuracy (%)88.2
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task54.95Accuracy (%)87.3
LA Leaderboard - EusExams Basque39.81Accuracy (%)87.2
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task80.74Accuracy (%)86.4
Open Arabic LLM - Arabic MMLU LAW (Professional)74.84Accuracy (%)85.8
LA Leaderboard56.49Average Score (%)83.8
Open Arabic LLM - Arabic MMLU HT High School Mathematics41.48Accuracy (%)82.1
Open Arabic LLM - Arabic MMLU HT College Mathematics46Accuracy (%)81.8

Interactive version: theaggregate.ai/model?slug=qwen-2-5-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.