Qwen 2.5 7B (IT) — benchmark results
Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1295 ± 51, rank #1542 of 1776 rated models, from 7 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BALROG TextWorld (LLM) | 3.9 | Progress (%) | 18.2 |
| BALROG NetHack (LLM) | 0 | Progress (%) | 16.7 |
| LEXam | 29.28 | Multiple-Choice Accuracy (%) | 16.7 |
| BALROG Crafter (LLM) | 16.4 | Progress (%) | 15.2 |
| BALROG BabaIsAI (LLM) | 12.5 | Progress (%) | 12.1 |
| BALROG BabyAI (LLM) | 14 | Progress (%) | 6.1 |
| BALROG MiniHack (LLM) | 0 | Progress (%) | 0 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-7b-it · How the rankings work · Data refreshed daily, snapshot 2026-07-22.