Qwen 2.5 3B Instruct — benchmark results

Alibaba Qwen 2.5 3B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1426 ± 9, rank #1099 of 1776 rated models, from 271 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open CoT - LogiQA9.42CoT Gain (%)93.5
LA Leaderboard - GalCoLA57.93Accuracy (%)92.6
Open LLM Leaderboard - MATH Level 536.78Score87.2
ChineseSafe Benchmark71.81Accuracy (%)85.2
Mobile-MMLU68.1Overall Accuracy (%)81
OpenEval - GPQA CoT32.74CoT Correctness (%)78.6
Open CoT - LogiQA 212.47CoT Gain (%)77.5
OpenEval - Omni-MATH20.52Accuracy (%)77.5
Open LLM Leaderboard - IFEval64.75Score76.9
LA Leaderboard55.93Average Score (%)76.5
OpenEval - IFEval Strict69.99Strict Accuracy (%)76.2
LA Leaderboard - AQuAS67.69Accuracy (%)75

Interactive version: theaggregate.ai/model?slug=qwen-2-5-3b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.