Qwen2.5-Math-72B-Instruct — benchmark results

Alibaba's 72B open math specialist (September 2024) using chain-of-thought and tool-integrated reasoning, hitting 92.9 on MATH with TIR. Provider: Alibaba. Released 2024-09-16. Access: Open.

Unified ELO 1493 ± 39, rank #827 of 1776 rated models, from 24 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 562.39Score99.9
Open LLM Leaderboard - BBH48.97Score89.6
Open LLM Leaderboard - MMLU-Pro42.36Score86.7
Omni-MATH36.2Overall Accuracy (%)85.7
Open LLM Leaderboard - MuSR16.34Score85.5
Open LLM Leaderboard - GPQA10.85Score81
U-MATH - Sequences & Series68.83Accuracy (%)78.8
U-MATH - Integral Calculus38.94Accuracy (%)77.3
Open FinLLM Reasoning - FinQA69.74Accuracy (%)76
U-MATH - Multivariable Calculus61.8Accuracy (%)75.8
U-MATH59.45Accuracy (%)72.7
U-MATH - Precalculus84.38Accuracy (%)68.2

Interactive version: theaggregate.ai/model?slug=qwen2-5-math-72b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.