Qwen2.5-Math-1.5B: benchmark results

Provider: Alibaba. Released 2024-09-16. Access: Open.

Unified ELO 1333 ± 1, rank #1301 of 1392 rated models, from 62 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MERA - ruMultiAr33.69EM (%)57.4
MERA - ruHumanEval14.09pass@1 (%)54.3
MERA - ruCodeEval7.99pass@1 (%)46.9
MERA - SimpleAr96.9EM (%)44.7
PhysicsFinals16.4Score (self-reported)43.8
MERA - ruModAr50.48EM (%)42.6
MERA - LCS11.4Accuracy (%)37.3
EuroEval Icelandic Knowledge3.42Knowledge Average Score (%)31.6
MERA - MathLogicQA36.66Accuracy (%)29.2
EuroEval Italian NLU - ScaLA IT5.26Linguistic acceptability Score (%)29.1
MERA - ruHHH55.62Accuracy (%)25.5
EuroEval Spanish NLU - ScaLA ES0.48Linguistic acceptability Score (%)24.5

Interactive version: theaggregate.ai/model?slug=qwen2-5-math-1-5b · How It Works · Data refreshed daily, snapshot 2026-09-05.